Загрузка видео...

Не удалось загрузить видео

На главную

DeepSeek-V4-Flash-DSpark on 4x RTX PRO 6000、かなり良いところまで来た。 - Single inference: ~328 tok/s - Batch throughput: ~1.7k tok/s

32,813 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 7

Фото профиля AI✖️Satoshi⏩️
AI✖️Satoshi⏩️2 месяцев назад

構成は vLLM + DSpark + B12X stack。 TP4、FP8 KV cache、B12X sparse MLA/MoE/FP8 GEMM、PCIe allreduce、GPU power limit 300W。 DSparkは num_speculative_tokens=5, draft_sample_method=greedy

Фото профиля AI✖️Satoshi⏩️
AI✖️Satoshi⏩️2 месяцев назад

Batch throughputはまだ伸ばせる余地あり、試してみます

Фото профиля Mia
Mia2 месяцев назад

🔥🔥🔥

Фото профиля Suneet Dungrani
Suneet Dungrani2 месяцев назад

Insane

Фото профиля Пандемониум
Пандемониум2 месяцев назад

So you are saying 4 pro 6000 are legit for v4 flash even with pci bottleneck?

Фото профиля Dejan Marjanović
Dejan Marjanović2 месяцев назад

chat is this real?

Фото профиля AI✖️Satoshi⏩️
AI✖️Satoshi⏩️2 месяцев назад

もちろんです。しかし、タスクによってaccept 率も変動して、同じハードでも結果は揺れます。V4本リリースに向け、検証続けてます。

Похожие видео

How Fast is Gemma 4 on a MacBook Pro M4? Benchmarking Google's new MoE (26B-A4B) > Model size: 26.1 GiB > Load time: ~4.2s Comparing single request VS > concurrent requests performance > 32k total context, 4 parallel slots single request behavior > TTFT: 5.68s > prompt: 3,701 tokens @ 652 tok/s > decode: 40.08 tok/s sequential (1 request at a time): > avg duration: 20.5s > p99: 22.1s > throughput: 40.11 tok/s > clean finishes: 100% concurrent (4 parallel requests): > aggregate throughput: 47.25 tok/s > total system throughput: 262.27 tok/s > avg duration: 65.1s > p95 latency: 68.8s > req/sec: 0.058 Head-to-Head: Sequential vs Concurrent throughput: > 40.11 tok/s → 47.25 tok/s (+17.8%) > small gain despite 4x parallelism latency per request: > 20.5s → 65.1s (~3.2x slower) > you pay heavily for concurrency system throughput (true utilization): > ~40 tok/s → 262 tok/s (~6.5x total output) > this is where concurrency wins tokens per second (decode ceiling): > ~40 tok/s steady in both modes > hardware-bound, not scheduler-bound TTFT impact: > ~5.7s baseline → buried under queueing in concurrent > “headers waittime” becomes the bottleneck What this actually means? - You don’t get linear scaling from parallel slots - You trade latency for total output - Mac Unified Memory setup is clearly saturating - Bandwidth + Scheduling overhead show up immediately This is exactly why GPUs dominate here Concurrency without killing latency

Ahmad

88,866 просмотров • 5 месяцев назад