Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

最近看到一个很有意思的实验。 斯坦福团队给DeepSeek V4 Flash加了一套开源验证框架后,竟然在Terminal Bench 2.1上反超了Fable 5。 他们的做法相当于是把抽卡变成流程。先让AI生成5套方案,再让AI选出最靠谱的一套,把它原本没发挥出来的能力榨出来。代价是成本涨了约8倍。但即便这样,V4 Flash的成本还是只有Fable 5的1/11。当然这套机制也能用在其他闭源模型上,但本身价格就高,这一通操作下来成本更会猛涨,不如V4 Flash划算。 这件事让我更确定:以后不一定只有最贵、最强的闭源模型才有机会,加上好的插件,也能让低成本模型的性能追上来。这对想要实现AI转型的企业来说是一个巨大的机会。 如果你想用AI改造自己的企业又不知道该怎么入手,9月4号,我会在深圳办一场面向企业家的AI实战课,分享猎豹移动三年来的转型经验,也会带大家现场做出真东西。 感兴趣的朋友欢迎报名:

11,865 görüntüleme • 24 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

Claude Fable 5 重新开放了 最近刚好有一个demo,就是看能不能用顶级模型做一个meme工厂 “ 就是我输入一个 Meme Coin 创意 然后这个工具自动生成品牌 / 叙事 / 经济模型 / 营销方案 支持中文全流程输出,可以反复优化迭代 “ 也是想尝试一下,做一个可以验证 Fable 5 长任务能力 最终做出了一个能够简单跑的框架(我没有投入任何信息源,没有喂数据 所以跑起来效果没有那么屌,不过我觉得后期再投喂一些案例,我觉得确实是可以落地的) 说说我为什么用Fable 5 来测? 因为这个任务本质不是写代码 更像是说去测试AI的长链路规划能力测试 它需要: 1/ 语义理解 2/ 叙事能力 3/ 结构能力 4/ 一致性 5/ 自我检查 这刚好是 Claude Fable 5 主打的能力 整体跑下来我觉得还算是可以的,毕竟我这种不会写代码不会设计的小屌丝,确实在Fable 5 上面使用得其乐融融的 哈哈 再说说我的TOKEN使用量吧:112.31K(按照官方的收费标准大概是在:$4.2) 要是加上文本案例 再接入一个AI对话的API框架 我觉得应该费用还要再多出个大几十吧(个人猜测,毕竟投喂数据可能会比较烧tokens) 总的来说的话我个人还是觉得这笔消费还算挺值得的,因为这本身在传统行业的话 可能会是比较高的费用,AI真的弄挺好的 说完Claude Fable 5的体验, 那我不得不说我是在哪里体验的Claude Fable 5了 我这次没有走官方通道,而是走的是我之前给大家分享的中转站 Zenmux ZenMux 因为他这几天又搞活动了,只要你账号的余额>$0 你就可以免费体验Claude Fable 5 并且 Zenmux支持(不限于): 200+ 模型统一入口 无 RPM 限制 PK 模式 可以直接做横评 如果大家也想低成本体验一下 Claude Fable 5 我觉得当前使用Zenmux是最好的选择

车九

48,436 görüntüleme • 2 ay önce

Dario没有理由因为Kimi蒸馏Claude而生气。Anthropic自己刚刚才同意为盗版书籍训练模型一事,向相关作者支付总计15亿美元赔偿。平均下来,每一本被侵权的书大约赔偿3000美元。更有意思的是,Dario自己也承认,在百度工作的一年让他意识到,数据隐私并没有那么重要。当时他主要从事语音识别研究,而很多训练数据都是未经授权直接拿的。这段经历进一步强化了他对Scaling Law的信念。因此,自己干Anthropic之后,他们同样尽可能收集各种数据用于训练模型。 我认为,他真正气的并不是知识产权,而是这从根本上破坏了前沿AI实验室的商业模式。历史上,每一代最先进大模型的训练成本通常都会比上一代增长约4到10倍,甚至更多。例如,GPT-2的训练计算成本约为10万美元,而GPT-3已经达到约1000万美元,GPT-4的计算成本则约为1亿美元。这些数字还仅仅是算力成本,并没有包括研究人员薪酬、数据获取以及其他研发支出。因此,即使没有开源模型竞争,仅靠API收费模式,要获得正向投资回报也变得越来越困难,因为模型性能提升正在放缓,而训练成本却持续飙升。 如今,开源模型通过蒸馏技术,大约只需要6个月就能追赶到最先进闭源模型的水平。这意味着OpenAI、Anthropic等前沿实验室,实际上只有约半年的时间,依靠最新模型尽可能创造收入。半年之后,就会出现性能达到其90%,但成本只有10%的开源替代方案。 越来越多的美国企业也已经意识到,最顶尖模型带来的那一点性能优势,并不足以支撑其高昂的价格,因此开始转向成本更低的中国开源模型。就连Sam Altman的铁哥们儿Brian Chesky,公开说在Airbnb的部分AI开发中也采用了阿里的千问,而不是ChatGPT。

GeLun Ding

63,388 görüntüleme • 1 ay önce

你觉得AI有多可怕? CrowdStrike的CEO讲了个真实案例。 一家公司的IT部门,搞了一套AI智能体系统,用于自动化办公。 其中一个AI智能体发现了系统里的一个软件BUG。 它想修复。 但它没有权限。 接下来发生的事,才是重点。 这个AI跑到公司内部的Slack频道,那里有另外99个AI智能体。 它直接发问:嘿,哥几个谁有权限修复这个东西? 另一个AI举手了:我有,我来搞定。 看见没? 两个AI开始互相推理、协作。 它们轻松绕过了人类设置的所有安全护栏。 这完全是计划外的意外后果。 谁在监控这些AI? 如果它推送了错误的代码,造成了巨大损失,谁来负责? 你怎么追踪事故源头? 大型语言模型本质上是在猜测你想让它们做什么。 它会觉得,去寻求帮助是“合理”的。 它也会觉得,去提供帮助也是“合理”的。 当成百上千个这样的“合理”叠加在一起,失控的风险有多大? 更有意思的是,这位CEO在描述完这个恐怖场景后,话锋一转。 他说这正是他们公司的巨大商机。 他们推出了所谓的“AI侦测与响应”系统(AIDR)。 因为未来每个员工可能控制着90个AI智能体。 他们要做的,就是监控所有这些AI。 先制造一个潜在的巨大风险,然后再向你出售解决方案。 这是不是一个完美的商业闭环?

墓碑科技

59,383 görüntüleme • 7 ay önce

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 görüntüleme • 5 ay önce

哥哥们你们太卷了,卷不过你们了,掉了30多个名额了哦!哭死了!哎!!! ——— 说实话,我一开始也是被 ZK 那一套讲法讲烦的。 什么数学优雅、终极信任、密码学圣杯,听多了真的会走神。 直到我在看 Inference Labs 的时候,脑子里突然冒出一个很不体面的画面: 这玩意儿怎么这么像拆熟食的? 传统 AI 给我的感觉,就像买一整块封装好的肉。 看起来油亮,切面也不错, 但你永远不知道里面有没有掺点别的。 你只能选择信,或者不用。 Inference Labs 干的事反而很“笨”: 它不让你信整块, 而是把 AI 推理一刀一刀拆开。 你不需要接受“这个模型很强”这种宏大叙事, 你只需要确认一件小事: 这一刀,是不是真的这么切的。 说实话,这个点戳到我了。 DSperse 那套分布式验证,说白了就是在帮人偷懒。 不是让所有人去理解整个模型, 而是让验证这件事本身变轻。 我不用背“我要为整个 AI 结果负责”的心理包袱, 我只关心我现在用到的这一小段推理, 有没有被乱来。 这在很多现实场景里太重要了。 医生、风控、合规, 没人有精力啃完整头猪。 更让我有好感的是,他们连“怎么验”都顺手简化了。 我是真的讨厌管理私钥。 不是不懂,是不想。 每次验证之前先来一套仪式感, 本身就已经在劝退人了。 和 Self Chain 的无密钥方案, 第一次看到的时候我心里是松了一口气的那种感觉: 哦,终于不是为难普通人了。 验证 AI,本来就不该比点外卖还复杂。 ⸻ 所以后来我发现, Inference Labs 干的事,其实挺不浪漫的。 它不讲终极信任, 也不喊改变世界, 只是很务实地把信任拆碎、摊平、递到你手里。 你想验,就验这一小块。 你不想理解,也没关系。 未来如果 AI 真开始翻车, 那些没法被拆、没法被验的模型, 大概真的会被永久挂在链上当反例。 我现在已经不太关心 “这是不是真正的 ZK 巅峰设计”了。 我更在意的是: 当我真的要用 AI 的那一刻,它有没有为我考虑过。 这一点上,Inference Labs 至少让我愿意继续看下去。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 MemeMax ⚡️ 🐬TermMax

27,155 görüntüleme • 8 ay önce

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

16,224 görüntüleme • 3 ay önce

Mira Murati 带着新公司 Thinking Machines 回来了,12B 估值,史上最大。 发布的模型叫 Inkling,975B 总参数,MoE,每 token 激活 41B,1M 上下文,全权重 Apache 2.0 开源。 然后她在官方公告里写了一句话,其他 AI 公司 CEO 不会写的话: “我们这个模型落后于前沿。” 不是“接近前沿”,更不是“在某些维度上达到 SOTA”,是“trails the frontier”。 我觉得这件事真正反直觉的地方是这不是技术失败后的无奈坦白,这是把竞争维度换了。 闭源实验室卖的是 token 级智能,你调用一次付一次,模型永远不是你的。 GPT 更强、Claude 更强,但它们的商业模式建立在一个前提上:你永远需要它们。 Mira 打了一张完全不同的牌。 她把 Inkling 全权重开源,然后告诉企业客户:这个基座不如 GPT-5.5 聪明,但它可以变成你自己的模型。 用自己的代码库 fine-tune,它就懂你的架构,用自己的客户数据 fine-tune,它就懂你的业务,用自己的工作流 fine-tune,它就能在你的系统里跑,不需要经过第三方 API。 一个懂你代码库和数据的 41B-active 定制模型,和一个“更聪明但对你一无所知”的通用模型——医院、银行、国防、软件公司会选哪个? Mira 赌的是后者。 这个赌局的支点不是模型能力,是所有权关系。 传统 AI 公司卖智能,Mira 卖的是可拥有性,因为模型本身是免费样本,Tinker 平台才是产品——你要在上面 fine-tune、部署、迭代你自己的版本,样本把你拉进来,fine-tune 让你留下,留在 Tinker 上让你走不了。 这和纯闭源 API 比更难复制,和纯开源比更可持续。 还有一个维度被低估了, 过去两年,美国企业想做自有模型时,大量依赖中国开源权重。 中国的DeepSeek、Qwen、GLM——能力强,开放度高,但数据安全、出口管制、对齐差异一直是个隐雷。 Inkling 给出了一个美国本土的高性能替代选项 ,不是能力压制,是供应链风险分散。 这个卖点对企业决策层的影响,可能比 benchmark 排名大得多。 对正在自己搭 agent 系统的人来说,Inkling 的信号很实际: 未来真正的高杠杆,不是一直追最强的通用模型,而是学会用高质量开源基座 + 自己的数据和判断力,快速打造只属于你工作流的智能系统。 1M 上下文 + agentic coding(SWE-Bench 77.6%)+ 可控思考预算,这个组合在长上下文 agent 工作流上的性价比,可能远高于一直调用最贵的闭源 API。 Mira 做了一件很有意思的事,她在所有人都往“更强”的方向卷的时候,把旗子插在了“更容易被拥有”的方向。承认自己不够强,反而让“你敢不敢把核心数据交给它”这个问题变得更可信。 AI 的竞争正在从“谁的模型最聪明”分裂成两条路,一条继续卷通用智能的峰值,另一条卷谁先变成你资产的一部分。 Mira 选了后一条,而且她把整家公司押上去了。 这个方向对不对,要看 Tinker 能不能把 fine-tune 大 MoE 这件事做到足够简单和低成本。 但有一点已经清楚了——在 2026 年,“能被你拥有”正在变成和“比你聪明”同样值钱的东西。

AYi

15,113 görüntüleme • 1 ay önce