正在加载视频...

视频加载失败

黄仁勋手上提的这个东西叫NVlink 英伟达最被低估的硬件 整个部分全部采用纯铜打造 现在训练大模型的最大瓶颈不是高带宽内存 是通信延迟 延迟决定了GPU利用效率 延迟 >内存>算力>算法

184,779 次观看 • 1 年前 •via X (Twitter)

3 条评论

Michael Chao e/acc🇸🇬🇺🇲🇮🇱 的头像
Michael Chao e/acc🇸🇬🇺🇲🇮🇱1 年前

听起来像是个魔法工具,真想看看它能如何“链接”我的思维!

Pwnage 的头像
Pwnage1 年前

Stormbreaker Max CF design to production Get the next generation of high end performance gaming mice. Shop now:

Hello,2025! 的头像
Hello,2025!1 年前

nvlink技术能用于局域网就好了

相关视频

很多人卸载了沉浸式翻译,我看上了里面那个贼快的模型供应商 卸载沉浸式翻译之后,用其他翻译插件明显感觉翻译变慢了,是肉眼可见的差异,所以去看了一下它的免费模型供应商,才发现它用的是 Stepfun。 Stepfun 有一个专门面向开发者的订阅计划叫 Step Plan,里面主推的模型是 Step 3.5 Flash 2603,官方定位就是“低延迟推理 + Agent 工作负载”。 这正解释了我之前的体验:不是翻译插件本身写得有多好,而是底层模型的推理管道极短,首 token 延迟压得很低。 为了验证这个结论,我直接买了一个 Step Plan,打算把它接到自己的翻译脚本上,量化看看它到底快在哪。 测试环境很简单,没有用现成的翻译插件,而是自己写了一个极简的网页翻译工具:浏览器扩展抓取当前页面选中文本,通过 API 发给 Step 3.5 Flash 2603,要求直接返回中文译文,不做额外解释。 我选了五个真实的英文网页做测试:一篇 Medium 技术博客(约 800 词)、一段维基百科词条(约 1500 词)、一份 arXiv 论文摘要页(约 3000 词)、再加一篇完整的英文报道(约 10000 词)。 每个网页取整页正文,连续测 10 次取平均值,同时用另一个主流 Flash 级模型做相同任务的对照。 结果可以说非常直观: - 800 词的技术博客,Step 3.5 Flash 2603 首 token 延迟平均 0.17 秒,我几乎感知不到等待。 - 1500 词的维基词条,首 token 延迟 0.20 秒,长段落也稳。 - 3000 词的论文摘要,首 token 延迟 0.25 秒,对比模型在这个量级已经开始出现首 token 延迟跃升到 0.5 秒以上。 - 10000 词的完整报道,这是最考验推理引擎的场景,首 token 延迟 0.34 秒,全程没有限流、没有中断,译文质量也没有因为速度快而出现乱翻或漏段。 对照模型在 3000 词以后的首 token 延迟普遍在 0.5-0.8 秒之间,10000 词时甚至接近 1 秒。 而 Step 3.5 Flash 2603 关闭推理后把“首字延迟”控制在 0.3 秒上下,这个数字正好是大多数人感知“即时反馈”的阈值。 也就是说,从你松手到译文出现,它快得像是提前算好了一样。 StepFun ⬇️

耳朵

44,320 次观看 • 4 个月前

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 次观看 • 8 个月前

美光1.2倍是半导体涨幅最大的今年超过英伟达,凭什么一个内存典型周期行业咸鱼翻身? AI 时代最火的故事是算力,大家都盯着 GPU,看谁的芯片更快、更强,谁能抢到英伟达份额。 但真正懂技术的人都知道GPU 只是发动机,内存才是油箱。内存还能继续吗?会不会24-27将进入一个超级周期… AI 的瓶颈不在算力,而在记忆力。没有足够快、足够大的内存,AI 就像一个健忘的天才,算得快但记不住。所以接下来的主角,不再是 GPU,而是内存。 全世界的内存产业正进入一个罕见的“超级周期”。核心产品叫 HBM(高带宽内存)。它的本质,就是把DRAM内存一层一层叠起来。AI 模型越大、推理越复杂,就越离不开它。 但能做 HBM 的,全世界只有三家公司:三星、SK 海力士、美光。不是因为别人不想做,而是因为这东西太难了。 这是一层层堆叠要精密级,良率要高,散热要稳,功耗还要低。谁能把这几个平衡点同时拿下,谁就能成为 AI 世界的“记忆中心”。 现在这个超级周期已经走到一半,需求没问题,供给也没问题,技术更是大突破。 唯一的风险是价格。当三家都量产、都认证通过,2026 年开始价格下滑几乎是必然。 这就是资本主义永远有竞争谁也不会一家独大,这是良性的,每次被新闻头条什么降价之类的杀情绪的时候、要记住: 这是一个被 AI 锁定的四年超级周期,HBM 是绝对的核心战场。 拿住 ALL IN。关注我,有逻辑变化,我会及时发布展望。

Tigris | 会讲课教授是好老师

172,785 次观看 • 1 年前