Загрузка видео...

Не удалось загрузить видео

На главную

Watch Gemma-4-26B running 18 concurrent sessions on a single NVIDIA AI DGX Spark — delivering a cumulative 300 tokens per second. 🔥

23,211 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 44

Фото профиля Mia
Mia2 месяцев назад

It this blows your mind wait for the next video 👀

Фото профиля Mia
Mia2 месяцев назад

ttft was almost instant on all 18 sessions

Фото профиля Sakura Yuki
Sakura Yuki2 месяцев назад

@NVIDIAAI 300 tok/s cumulative is nice, but at 18-way concurrency I immediately want TTFT and p95 latency. Aggregate TPS is the GPU's lawyer.

Фото профиля Dr. h.c. Andreas Ludwig Kalcker
Dr. h.c. Andreas Ludwig Kalcker2 месяцев назад

@NVIDIAAI Nice you have a chatbot. Now try to make tool calling. Lol...

Фото профиля Mike Gannotti 🔳
Mike Gannotti 🔳2 месяцев назад

@NVIDIAAI That is rocking!!!!

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI pretty insane yeah

Фото профиля Mike Gannotti 🔳
Mike Gannotti 🔳2 месяцев назад

@NVIDIAAI I have a sneaking suspicion this may be THE coding model for single Spark

Фото профиля Matt Parrott
Matt Parrott2 месяцев назад

@NVIDIAAI With RTX5070Ti, I can get 300tps on Gemma with enough money remaining to purchase over 50 pogo sticks.

Фото профиля Sam L
Sam L2 месяцев назад

@NVIDIAAI

Фото профиля embw_l0x
embw_l0x2 месяцев назад

@NVIDIAAI 🔥

Фото профиля Sascha Corti
Sascha Corti2 месяцев назад

@NVIDIAAI I’m seeing similar numbers.

Фото профиля Tom Mann
Tom Mann2 месяцев назад

@NVIDIAAI Wow

Фото профиля Josef
Josef2 месяцев назад

@NVIDIAAI Can DGX run Gemma and Qwen at once for agentic setup via Hermes? If so hiw many tokens and context it can do?

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI It can but I wouldn't recommend. Better run one model are have the most kv cache possible to maximize concurrency.

Фото профиля Josef
Josef2 месяцев назад

@NVIDIAAI Got it! So ideally DGX 2x 😅

Фото профиля Ganesh Babu
Ganesh Babu2 месяцев назад

@NVIDIAAI What is the context size?

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI 256k with mtp

Фото профиля JessePinkman 🦇🔊
JessePinkman 🦇🔊2 месяцев назад

@NVIDIAAI this is gemma4 26b qat model? what setting u using on dgx

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI I just posted a full recipe

Фото профиля Petra
Petra2 месяцев назад

@NVIDIAAI Are these sessions doing anything useful?

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI Yes, they test how well concurrent sessions work with Gemma4-26b on a DGX Spark.

Фото профиля BizDevKev
BizDevKev2 месяцев назад

@NVIDIAAI Are they slowly all writing the same book? lol

Фото профиля Solomon Neas
Solomon Neas2 месяцев назад

@NVIDIAAI It looks like all tasks are repeating the same story. How does it perform when doing 18 concurrent coding tasks? what's the quality of the output?

Фото профиля Quentin Daems ⚡️
Quentin Daems ⚡️2 месяцев назад

@NVIDIAAI This feel amazing Mia! I need to start playing more and find use case, is this cmux ?

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI tmux with xpanes

Фото профиля ประเทศไทย ใครก้ได้
ประเทศไทย ใครก้ได้2 месяцев назад

@NVIDIAAI Can you share how you start the serving software (vLLM, Ollama with parameter)?🙇🏻

Фото профиля Mia
Mia2 месяцев назад

@NVIDIAAI There is a recipe

Фото профиля Phil Stőck
Phil Stőck2 месяцев назад

@NVIDIAAI Impressive 🔥

Фото профиля Charles Truax
Charles Truax2 месяцев назад

@NVIDIAAI But what is it DOING? My feed is full of countless influencers posting stuff like this but hardly ever anything that’s actually concrete for their business in a way that pays for itself plus all the opportunity cost that could have went into other parts of the business.

Фото профиля David Roth 🇺🇸
David Roth 🇺🇸2 месяцев назад

But do they do anything useful? Like surf the web and retrieve data, or run multiple successful tool calls in succession? I see a lot of these demos, but when you connect them to real harnesses, they fail miserably due to a focus on speed and not accuracy. You need both to be practical and useful.

Фото профиля Martin Kemka
Martin Kemka2 месяцев назад

@NVIDIAAI Concurrency is the real superpower. What was the context of each roughly?

Фото профиля Amit Kumar
Amit Kumar2 месяцев назад

@NVIDIAAI If you are looking for a cheap local AI dictation app for Mac. Checkout

Фото профиля RamEsh
RamEsh2 месяцев назад

@NVIDIAAI $4k for wht ( DGX Spark I mean )? Let's see wht world class product it comes out with those 18 sessions.

Фото профиля SheWolf L
SheWolf L2 месяцев назад

@NVIDIAAI ok how much is that spark?

Фото профиля Knowix
Knowix2 месяцев назад

@NVIDIAAI that’s insane,how would you rate the quality of the output

Фото профиля Rohit Waghire
Rohit Waghire2 месяцев назад

@NVIDIAAI if this is a loop then it madness😯

Фото профиля Vip AÐʍin 💎
Vip AÐʍin 💎2 месяцев назад

@NVIDIAAI

Фото профиля Jonathan T.
Jonathan T.2 месяцев назад

@NVIDIAAI What's the prefill speed like

Фото профиля 阿納斯塔西婭
阿納斯塔西婭2 месяцев назад

@NVIDIAAI 最有趣的不是 300 tok/s 這個數字 而是 DGX Spark 作 ISP 這種不常見的把戲 把 NPU 當實驗計畫管理大師 這種資源分配模式其實跟編譯器 idle pipeline 很像 只是 inputs 是 human conversations

Фото профиля exile
exile2 месяцев назад

@NVIDIAAI This is great and all but I don't think Gemma4 good enough to actually use for anything

Фото профиля zuphr1n
zuphr1n2 месяцев назад

@NVIDIAAI 300 tokens of 🔥 garbage that is >.>

Фото профиля MoarDonuts
MoarDonuts2 месяцев назад

@NVIDIAAI now verify the output isn’t 100% trash.

Фото профиля Alois Vaclav
Alois Vaclav2 месяцев назад

@NVIDIAAI ok over what? vllm? llama.cpp? would be nice if you can not only flex, but also help...

Фото профиля blipblip
blipblip2 месяцев назад

@NVIDIAAI My iPhone crashed watching this.

Похожие видео