Загрузка видео...

Не удалось загрузить видео

На главную

NVIDIA drop a 3B vision-language model for fast, high-quality visual grounding in real time accurately. - Parallel box decoding - 10× faster than Qwen3-VL - Trained on 138M queries/785M boxes - GUI, OCR, and document layout, dense detection - Open source Useful for computer-use agents and Physical AI,

131,447 просмотров • 4 дней назад •via X (Twitter)

Комментарии: 14

Фото профиля Md Ismail Šojal 🕷️
Md Ismail Šojal 🕷️4 дней назад

Worth a look if you work on agents, robotics, or document AI. -

Фото профиля falky
falky4 дней назад

shit is 4 months old, fucking clickbait

Фото профиля Fajar M Reza
Fajar M Reza4 дней назад

Does the 10× speedup hold on GUI workloads, or mainly dense grounding?

Фото профиля Samurai.AI
Samurai.AI4 дней назад

@skalskip92

Фото профиля SHK
SHK4 дней назад

@grok find this model to download

Фото профиля Dylan Colquhoun
Dylan Colquhoun4 дней назад

Whats the optimal packing of 17 boxes in a square?

Фото профиля Derek Chia
Derek Chia4 дней назад

Parallel box decoding sounds like the real trick. How does it hold up on dense GUI screens versus Qwen3-VL?

Фото профиля CEO del Socialismo de Mercado🌹🕊️ 市场社会主义CEO
CEO del Socialismo de Mercado🌹🕊️ 市场社会主义CEO4 дней назад

Locate Anything?

Фото профиля Pies Avalon
Pies Avalon4 дней назад

The final form of this will be an api service like jev.

Фото профиля Jim Wallace
Jim Wallace4 дней назад

That scene in The Matrix Reloaded could use some DLSS5 treatment tho

Фото профиля Artzy
Artzy4 дней назад

The throughput on that box decoding is wild

Фото профиля 安叫兽|Bird🕊️ 🔶 BNB
安叫兽|Bird🕊️ 🔶 BNB4 дней назад

3B 还能跑这么快,GUI 场景应该挺香,等实测了

Фото профиля Antonio Rocha
Antonio Rocha4 дней назад

É mais rapido que o YOLO 26?

Фото профиля Ramesh Devasi
Ramesh Devasi4 дней назад

why i am not able to get simple 4 corner flat planer tracker which can run in web

Похожие видео