Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

WorkBuddy上大模型测试第四弹 继续对比DeepSeek V4 Flash和DeepSeek V4 Pro两个大模型 prompt:生成一个svg动画:鹈鹕骑自行车,用H5给我展示下 目前表现: DeepSeek V4 Flash生成结果已经够烂了,但是当我看到DeepSeek V4 Pro的生成结果后,直接绷不住笑喷了 两破烂王,车轮子满天乱飞,pro版直接是连车都没了🤣 测试结果见下面视频👇

44,012 Aufrufe • vor 9 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

刚看完 SemiAnalysis 这篇 DeepSeek V4 推理性能长文,很有意思。 DeepSeek V4 一出来,被考试的是 NVIDIA、AMD、Huawei、vLLM、SGLang、TensorRT-LLM、ROCm、CANN 这一整套推理生态。 省流一下 SemiAnalysis 这篇的几个核心点: 1/ CUDA + vLLM / SGLang 仍然是 Day 0 最稳的生态。DeepSeek V4 Pro 发布当天,CUDA 平台上的 vLLM 和 SGLang 基本能直接跑,B200/B300 这类新 SKU 的 recipe 也大多开箱可用。 vLLM 和 SGLang 这两个开源推理引擎,已经是全球 ML 基础设施的核心组件了,各自独立出来成了公司(Inferact 和 RadixArk),融了几亿美金。他们的生态优势在这时候体现得最明显:新模型一出,开源生态能在第一时间接住。 2/ AMD 一开始很狼狈。MI355X Day 0 只能跑 FP8,交互性低到 1-2 tokens/user/sec,SemiAnalysis 直接说这不是生产可用状态。不过后面 AMD SGLang 团队 26 天内把性能拉了 100x 以上,这个追赶速度也很夸张。 3/ TensorRT-LLM 反而翻车了。他们有个 kernel 把 DeepSeek 的 hidden size 写死了 4096,这个问题拖了一周多才被注意到,SemiAnalysis 后来自己提 PR 修掉。 4/ Huawei Ascend 这次是另一条主线。华为 Ascend 950DT,在 DeepSeek V4 发布当天就提供了推理支持。CANN 发了优化指南和 benchmark 数据,也展示了从 kernel、graph path、quantization 到 serving / deployment recipe 的 full-stack 思路。 SemiAnalysis 的判断很明确:DeepSeek V4 的 Day 0 支持栈里,真正接住的只有两个,NVIDIA CUDA 和 Huawei CANN。 5/ GB300 NVL72 的 rack-scale 优势非常明显。SemiAnalysis 给的测算里,GB300 在 MTP 打开后几乎统治所有 interactivity level,50 tok/s/user、8k input、1k output 假设下,output token 成本可以到 $0.156 / million。 总结一下我的观感。 DeepSeek V4 的发布,本质上是一次对整个推理生态的年度统考。CUDA 生态依然最强,但华为的 Day 0 支持证明了 CANN 栈的成熟度正在快速提升。AMD 能在 26 天内追 100 倍,说明工程能力没问题,但 Day 0 的差距暴露了 ROCm 生态的脆弱。 TensorRT-LLM 的翻车,和 vLLM/SGLang 开箱即用的对比,可能是这篇文章最值得玩味的细节。闭源引擎的优化上限可能更高,但在 Day 0 这个时间窗口里,开源生态的响应速度是不可替代的。 问题变成了:当中国最好的开源模型之一(DeepSeek),遇上中国最好的 AI 芯片软件栈(CANN),这种 co-design 的优势会持续多久?NVIDIA 的护城河到底在硬件还是在软件? 感觉这个问题,可能比模型本身的参数量重要得多。

AI Dance

18,680 Aufrufe • vor 3 Monaten

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 Aufrufe • vor 3 Monaten