Загрузка видео...
Не удалось загрузить видео
DeepSeek-V4-Flash-DSpark on 4x RTX PRO 6000、かなり良いところまで来た。 - Single inference: ~328 tok/s - Batch throughput: ~1.7k tok/s
32,813 просмотров • 2 месяцев назад •via X (Twitter)
Комментарии: 7

AI✖️Satoshi⏩️2 месяцев назад
構成は vLLM + DSpark + B12X stack。 TP4、FP8 KV cache、B12X sparse MLA/MoE/FP8 GEMM、PCIe allreduce、GPU power limit 300W。 DSparkは num_speculative_tokens=5, draft_sample_method=greedy

AI✖️Satoshi⏩️2 месяцев назад
Batch throughputはまだ伸ばせる余地あり、試してみます

Mia2 месяцев назад
🔥🔥🔥

Suneet Dungrani2 месяцев назад
Insane

Пандемониум2 месяцев назад
So you are saying 4 pro 6000 are legit for v4 flash even with pci bottleneck?

Dejan Marjanović2 месяцев назад
chat is this real?

AI✖️Satoshi⏩️2 месяцев назад
もちろんです。しかし、タスクによってaccept 率も変動して、同じハードでも結果は揺れます。V4本リリースに向け、検証続けてます。
