Загрузка видео...
Не удалось загрузить видео
NVIDIA 刚开源的这个 LocateAnything 模型,真的有点强。🤯 以前那种视觉定位模型,生成坐标是一个数字一个数字往外蹦(像挤牙膏一样),又慢又不稳定。 这个新模型用了“并行边界框解码”,直接一步预测完整坐标,速度快多了,框得也准。 不管是找视频里的物体,还是识别UI界面、OCR文字,它都能搞定。 最关键是模型很小,只有 3B 参数(约7.8GB),消费级显卡也能本地跑!🏠💻 做计算机视觉或者多模态的朋友,这个必须得试试。 项目已开源,手慢无!👇
37,623 просмотров • 3 месяцев назад •via X (Twitter)
Комментарии: 16

视频中GitHub🔗

推荐大家在这个网站使用这个大模型:

@VincentLogic 我已经部署了😄,大家随便用吧,前五次免费,注册送 10 块额度👌

@VincentLogic Any idea of it would work for creating a homography of say a dart board

@VincentLogic 這麼強的模型,雖然不到8GB,但是要佈置到端測還是太大了.

端侧不一定要一上来跑满血版。真正有意思的是分层:手机端做低延迟粗定位/候选区域,云端或本地更大模型做复杂理解;或者通过量化、蒸馏、NPU 加速跑轻量版。8GB 听起来大,但对“相机变实时视觉接口”这件事来说,已经很接近可产品化了。

@VincentLogic 3B params, runs on consumer GPUs, predicts full coordinates in one shot. NVIDIA just made visual localization accessible to everyone 👀

没错,被低估的不只是准确率,而是可获得性。 一旦视觉定位能在消费级 GPU 本地跑,很多“Agent 看见屏幕/现实世界并执行动作”的工作流都会更容易做出来。

@VincentLogic Exactly. Agents that can actually see and act on the real world locally is a completely different category of capability.

@VincentLogic 我的pro600blackwell跑了,消耗27g显存

27G 显存还是有点肉疼 😂 但能本地跑已经很关键了。后面如果量化/推理优化跟上,这类视觉定位模型就真能进桌面 Agent 和机器人工作流了。

@VincentLogic That sounds amazing! You can actually try it out right now—HyperAI ( has already launched a live demo for everyone to experience:

@VincentLogic 这玩意儿要是能集成到手机相机里,找东西就不用翻半天了,强迫症狂喜。

对,真正吓人的不是“能框出来”,而是它把视觉定位从「专用模型+复杂后处理」变成了「自然语言任务接口」。 一旦跑到手机端,相机就不只是拍照了,而是实时可编程传感器:找东西、识别状态、导航、质检、AR 交互都能被一句话调用。

@VincentLogic 这模型看着真香🥹本地跑得动太友好了

哈哈是的,3B 能消费级显卡本地跑,这点很香。以后不是所有视觉任务都要上云端大模型,很多‘找东西、框东西、点东西’可以直接在本地解决。
Похожие видео
Sensitive content
现在图生视频都在5秒或10秒,10秒的看上去像5秒的慢放,这个无论是在开源模型还是闭源模型上都有类似效果。尤其对于商业闭源视频来说,如果花费一倍以上的成本生成的10秒视频却只是5秒的慢放版,那就显得太不划算了。这里尝试一个方案:从商业闭源模型生成5秒视频,然后用插帧模型生成10秒视频,以下是使用Topaz插帧和原生的对比,供 这里尝试一个方案:从商业闭源模型生成5秒视频,然后用插帧模型生成10秒视频,以下是使用Topaz插帧和原生的对比,供大家参考。 #女s #les #女仆 #AI视频
獨自懵逼
20,065 просмотров • 1 год назад
