Загрузка видео...

Не удалось загрузить видео

На главную

NVIDIA 刚开源的这个 LocateAnything 模型,真的有点强。🤯 以前那种视觉定位模型,生成坐标是一个数字一个数字往外蹦(像挤牙膏一样),又慢又不稳定。 这个新模型用了“并行边界框解码”,直接一步预测完整坐标,速度快多了,框得也准。 不管是找视频里的物体,还是识别UI界面、OCR文字,它都能搞定。 最关键是模型很小,只有 3B 参数(约7.8GB),消费级显卡也能本地跑!🏠💻 做计算机视觉或者多模态的朋友,这个必须得试试。 项目已开源,手慢无!👇

37,623 просмотров • 3 месяцев назад •via X (Twitter)

Комментарии: 16

Фото профиля Vincent
Vincent3 месяцев назад

视频中GitHub🔗

Фото профиля Vincent
Vincent3 месяцев назад

推荐大家在这个网站使用这个大模型:

Фото профиля sy l
sy l2 месяцев назад

@VincentLogic 我已经部署了😄,大家随便用吧,前五次免费,注册送 10 块额度👌

Фото профиля Plankton
Plankton3 месяцев назад

@VincentLogic Any idea of it would work for creating a homography of say a dart board

Фото профиля GraysonKYC (✈️,🏨)
GraysonKYC (✈️,🏨)3 месяцев назад

@VincentLogic 這麼強的模型,雖然不到8GB,但是要佈置到端測還是太大了.

Фото профиля Vincent
Vincent3 месяцев назад

端侧不一定要一上来跑满血版。真正有意思的是分层:手机端做低延迟粗定位/候选区域,云端或本地更大模型做复杂理解;或者通过量化、蒸馏、NPU 加速跑轻量版。8GB 听起来大,但对“相机变实时视觉接口”这件事来说,已经很接近可产品化了。

Фото профиля AI Mastery Guide
AI Mastery Guide3 месяцев назад

@VincentLogic 3B params, runs on consumer GPUs, predicts full coordinates in one shot. NVIDIA just made visual localization accessible to everyone 👀

Фото профиля Vincent
Vincent3 месяцев назад

没错,被低估的不只是准确率,而是可获得性。 一旦视觉定位能在消费级 GPU 本地跑,很多“Agent 看见屏幕/现实世界并执行动作”的工作流都会更容易做出来。

Фото профиля AI Mastery Guide
AI Mastery Guide3 месяцев назад

@VincentLogic Exactly. Agents that can actually see and act on the real world locally is a completely different category of capability.

Фото профиля AiFish
AiFish3 месяцев назад

@VincentLogic 我的pro600blackwell跑了,消耗27g显存

Фото профиля Vincent
Vincent3 месяцев назад

27G 显存还是有点肉疼 😂 但能本地跑已经很关键了。后面如果量化/推理优化跟上,这类视觉定位模型就真能进桌面 Agent 和机器人工作流了。

Фото профиля Hyper.AI
Hyper.AI3 месяцев назад

@VincentLogic That sounds amazing! You can actually try it out right now—HyperAI ( has already launched a live demo for everyone to experience:

Фото профиля 尼古拉斯定投
尼古拉斯定投3 месяцев назад

@VincentLogic 这玩意儿要是能集成到手机相机里,找东西就不用翻半天了,强迫症狂喜。

Фото профиля Vincent
Vincent3 месяцев назад

对,真正吓人的不是“能框出来”,而是它把视觉定位从「专用模型+复杂后处理」变成了「自然语言任务接口」。 一旦跑到手机端,相机就不只是拍照了,而是实时可编程传感器:找东西、识别状态、导航、质检、AR 交互都能被一句话调用。

Фото профиля joker
joker3 месяцев назад

@VincentLogic 这模型看着真香🥹本地跑得动太友好了

Фото профиля Vincent
Vincent3 месяцев назад

哈哈是的,3B 能消费级显卡本地跑,这点很香。以后不是所有视觉任务都要上云端大模型,很多‘找东西、框东西、点东西’可以直接在本地解决。

Похожие видео

无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:

实践哥 Li

83,455 просмотров • 5 дней назад

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 просмотров • 3 месяцев назад