Loading video...

Video Failed to Load

Go Home

卧槽,说个颠覆我认知的事, 现在AI 把算命这件事,已经干到了全球大赛接近人类顶尖的水平,直接把通用大模型都甩开了一大截! 说实话,我一开始看到这个消息, 第一反应是又来个蹭玄学流量的 AI 噱头, 直到翻完它的完整技术报告和大赛数据, 才发现我完全想错了, 这是 2025 年第十六届全球算命师大赛, 足足 3069 名参赛者,全是行业里的真人从业者, 不是什么野鸡比赛。 之前很多人做 AI 命理, 无非就是把排盘数据往 Prompt 里一塞, 让通用大模型硬猜, 结果全是结构性的硬伤。 命理这东西,衍生数据组合爆炸, 各种宫位的空间关系, 序列化之后直接丢了关键信息, 长链推理越跑越偏,再加上专业语料稀缺, 幻觉满天飞,根本没法用。 哪怕是Claude Opus 这种顶流通用模型, 在这个赛道里,准确率也只做到了 40%。 但这个叫 Tianfu Agent 的产品, 直接干到了 50% 的截尾均值准确率, 人类大赛 Top20 的平均水平,也才 53.5%, 只差 3.5 个百分点就摸到了人类顶尖从业者的门槛, 比通用模型的天花板,直接高出了...

204,795 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

张雪峰真是大善啊,高考孩子有福气了。张雪峰老师虽然走了,他那套帮人选专业的核心认知全在。 有人干了一件特别牛逼的事。把张雪峰十年直播里反复用的那套判断框架,蒸馏成了一个开源的 AI Skill。5本书、15篇采访、30多条语录,一层一层提炼出5个心智模型:社会筛子论、就业倒推法、阶层现实主义、不可替代性检验。 我给你翻译一下这是什么意思。 你问它一个问题,它不是说一堆正确的废话。而是先查你有没有行业资源,再看这个专业毕业生中位数的去向,最后给你一个你够得着的方向。 不讲鸡汤。不画大饼。 老王把这东西接成了免费的高考答疑AI工具,现在谁都能用,网址: 模型全免费,你直接提问就行。 三个场景,我说说有多实用。 第一种,正填志愿的考生。拿分数、省份、想报的专业,三个要素丢过去。它按中位数去向给判断,告诉你这个分段能去哪、出来做什么、值不值得去。 第二种,孩子要选专业的家长。这也是张雪峰直播间十年反复问的一套逻辑——先别问什么专业好,先问你家里有什么行业资源,再去看这个行业出口在哪。工具会按这个顺序反过来问你。 第三种,纠结考研还是工作的。它会先问你什么专业。不同专业,答案完全不一样。学计算机的和学生物的,走的路能一样吗。 但说真的,这东西真正值钱的,不是回答本身。 是一个人的认知框架,被保留下来、被复用、被放大了。 你想想看,张雪峰做了十年直播,核心就五六个判断模型,翻来覆去地用。现在这些模型结构化地写进了 Skill 文件,谁装上,谁就继承了这套判断逻辑。代码是死的,判断是活的。 志愿这件事,信息差就是命差。 张雪峰不在了,这套框架没走。

产品经理老王霸

43,603 views • 1 month ago

卧槽,最近看有人开始推AI 玄学,出于好奇我给阿迪王: Dario Amodei 大兄弟算了一卦😂 说他2026年是事业增长和财富增长的机遇之年,岂不是吗,anthropic 估值都快破万亿了。。。 看分析过程(见视频),我第一反应是:这东西怎么还真有点像那么回事? 于是顺手研究了下背后的项目,发现它比“AI 算命”这个标签有意思多了。 这个系统叫 Tianfu Agent,一个面向命理推理的 Agentic AI 系统。 在 MingLi-Bench评测上:基于 2025 年全球算命师比赛题库,让 AI 回答真实比赛里的命理选择题。 结果挺反直觉:Tianfu Agent 在 MingLi-Bench 上的截尾均值准确率达到 50%,超过作者测试中的最佳通用大模型基线 40%,接近人类 Top 20 选手平均水平 53.5%。 命理其实很适合做 Agent 压力测试:规则多、流派多、推理链长,还有大量空间关系和经验判断,很多结论也没法像代码测试一样立刻验证。 如果只是把八字、紫微斗数知识塞进 Prompt,大模型很容易说得像那么回事,但推理链未必稳定。 Tianfu Agent 的做法更像给模型搭了一个领域专用工作台: 可计算的部分,交给工具算。 复杂规则,封装成可调用函数。 不同流派的判断,交给多个 Sub-Agent 推理。 有分歧和不确定性的地方,再用置信度综合。 它里面有 200+ 个原子工具,负责排盘、时间推演、空间路径等确定性计算。 这个思路很像 coding agent:模型本身未必突然变全知,但一旦被放进有工具、有反馈、有流程的环境里,能力边界会被拉开。 MingLi-Bench 有意思的地方在于:它用一个非常玄的场景,展示了很多专家能力被工程化的可能性。 命理只是一个极端样本。法律、医疗、投研、咨询、教育里,那些依赖经验和判断的环节,有多少也可以被拆成一套 Agent 工具链? 最玄的领域,反而暴露了很现实的 AI 产品方向。 Benchmark 链接: 有没有感兴趣的朋友,帮我算算 C 罗今年能不能夺冠啊🐶

岚叔

27,278 views • 2 months ago

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

193,594 views • 22 days ago

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

301,443 views • 1 year ago

哥哥们你们太卷了,卷不过你们了,掉了30多个名额了哦!哭死了!哎!!! ——— 说实话,我一开始也是被 ZK 那一套讲法讲烦的。 什么数学优雅、终极信任、密码学圣杯,听多了真的会走神。 直到我在看 Inference Labs 的时候,脑子里突然冒出一个很不体面的画面: 这玩意儿怎么这么像拆熟食的? 传统 AI 给我的感觉,就像买一整块封装好的肉。 看起来油亮,切面也不错, 但你永远不知道里面有没有掺点别的。 你只能选择信,或者不用。 Inference Labs 干的事反而很“笨”: 它不让你信整块, 而是把 AI 推理一刀一刀拆开。 你不需要接受“这个模型很强”这种宏大叙事, 你只需要确认一件小事: 这一刀,是不是真的这么切的。 说实话,这个点戳到我了。 DSperse 那套分布式验证,说白了就是在帮人偷懒。 不是让所有人去理解整个模型, 而是让验证这件事本身变轻。 我不用背“我要为整个 AI 结果负责”的心理包袱, 我只关心我现在用到的这一小段推理, 有没有被乱来。 这在很多现实场景里太重要了。 医生、风控、合规, 没人有精力啃完整头猪。 更让我有好感的是,他们连“怎么验”都顺手简化了。 我是真的讨厌管理私钥。 不是不懂,是不想。 每次验证之前先来一套仪式感, 本身就已经在劝退人了。 和 Self Chain 的无密钥方案, 第一次看到的时候我心里是松了一口气的那种感觉: 哦,终于不是为难普通人了。 验证 AI,本来就不该比点外卖还复杂。 ⸻ 所以后来我发现, Inference Labs 干的事,其实挺不浪漫的。 它不讲终极信任, 也不喊改变世界, 只是很务实地把信任拆碎、摊平、递到你手里。 你想验,就验这一小块。 你不想理解,也没关系。 未来如果 AI 真开始翻车, 那些没法被拆、没法被验的模型, 大概真的会被永久挂在链上当反例。 我现在已经不太关心 “这是不是真正的 ZK 巅峰设计”了。 我更在意的是: 当我真的要用 AI 的那一刻,它有没有为我考虑过。 这一点上,Inference Labs 至少让我愿意继续看下去。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 MemeMax ⚡️ 🐬TermMax

27,155 views • 7 months ago

印度正在干一件大事。 一件很安静,但可能影响深远的事。 他们在从零开始,构建一个梵语大语言模型。 梵语,是世界上最古老的结构化语言。 这个项目,不是简单的翻译工具。 更不是把古籍扫描数字化就完事了。 他们要让AI真正“学会”梵语,用梵语的逻辑去思考。 牵头的是一家有118年历史的梵语学院,和印度顶尖的理工学院IIT马德拉斯分校。 学者和数据科学家坐到了一起。 第一步,也是最难的一步,建立语料库。 他们收集了超过11万份梵文文本。 包括经文、孤本、还有数千份手稿。 为了处理这些古老的手稿,团队自己开发了专有软件。 结果惊人。 24小时内数字化了超过1000本梵语书籍。 每页只有三到四个错误,准确率接近97%。 梵语的语法结构极其复杂和精确。 比如“Sandhi”这种连音变化规则,还有复杂的词形变化,对AI的挑战远超英语。 解决这些难题,需要全新的算法和模型。 这暴露了一个关键问题。 当下的AI模型,本质上是基于英语世界的逻辑和数据结构建立的。 而印度这个项目,试图用一种完全不同的文明底层逻辑来训练AI。 这不仅仅是技术问题。 这关乎一个文明的记忆,能否在机器时代被完整保留,甚至被激活。 当全球科技巨头都在追求更大规模的模型、更快的算力时,印度选择了一条不同的路。 深度优先,而非规模。 结构优先,而非噪音。 意义优先,而非模仿。 这引出了一个更深层的问题。 AI的未来,是否也依赖于人类最古老的智慧? 如果这个实验成功,梵语将不再仅仅是被“保存”的遗产。 它将成为一种可计算的,具备严谨逻辑推理能力的工具。 这是一个国家在尝试用自己的文化之根,去定义自己的科技未来。 而不是被动地接受硅谷制定的标准和游戏规则。 这种对自己文明的自信和投入,值得深思。 当一个国家开始系统性地将自己的古典智慧与最前沿的科技结合,它的目标可能远不止是开发一个AI模型那么简单。

墓碑科技

22,272 views • 6 months ago

天才数学家陶哲轩对数学AI的思考 像真的,但其实不对。 AI写出的证明,乍看完美无瑕,细看漏洞百出。 为什么? 因为它没有“嗅觉”。 今天的AI,已经完全能通过“目测测试” 生成的内容看起来专业、太对味了。 但一旦你靠近它、认真嗅一下,就会发现它撒了香水 掩盖的,是逻辑上的腐臭。 不像传统的初学者那种“明显错”, AI的问题常常隐藏在最高级别的伪装底下: 写得太好,看不出哪里坏。 就像Terry Tao说的:“数学,是有味道的。” 一个真正靠谱的证明,不只是形式正确,而是通体带着那种“对的直觉” 结构自然、推理顺畅、细节干净利落。就像人闻食物的味道,不需要吃一口,就知道有没有毒。 AI没有这个。 它可以模仿口感,复制包装,但闻不到底层的真实。因为它是在学“怎么看起来像对的”,而不是“为什么它是真的”。 你可以把它理解为一个训练过非常精良的演员,知道什么时候该皱眉、什么时候叹气,用上最漂亮的定理、最熟练的转折,但它不明白它的角色到底在干什么。 而这,正是问题所在。 人类在判断一个复杂证明时,靠的不止是推理,更靠一种经验直觉:这个步骤自然吗?这个拆解方式靠谱不靠谱?这个结构合理不合理?我们甚至很难说清楚“为什么不行”,但就是知道,“不对劲”。 这就是“数学的嗅觉” 你说不明白,但你能闻得出来。 AlphaGo和AlphaZero之所以能搞定围棋和国际象棋,不是因为它们穷举了所有下法,而是因为它们学会了在哪些局面里,有“胜利的味道”。 即便讲不出理由,它们凭那股味道,也能找到通向胜利的路。 数学AI要想达到人类水平,它得也有这种“方向感”。 不是生成个像样的证明,而是能问自己:“我是不是在一个貌似正确,实际上死路的方向上走太远了?” 也许未来某一天,它能真正感觉到:“这一步味道不对,我得退回来。” 那一天,它就不只是一个生成文本的工具,而是真正的数学伙伴了。 🙋‍♂️人有灵气

墓碑科技

120,892 views • 1 year ago

凭啥说中国🇨🇳未来是美国🇺🇸唯一对手?你把一颗螺丝、一个零件、一个驱动程序拆开看,它什么都不是。但中国人擅长的不是某一个点,而是把所有点“组装成系统”的能力。上世纪90年代,美国搞去工业化,把制造业往外甩,老美资本家兴奋地下注:我们掌握设计、技术和规则,低端的制造就让“中国工厂”搞定。没人意识到,这不是工厂的外包,这是工业文明主动放弃了自己的“系统底盘”。风险?独家解读⬇️ 什么是底盘。美国🇺🇸它丢掉的是整个“Industrial Commons”—设计、试产、测试、修正、工艺优化……整条从实验室到量产的链条。 你可以限制光刻机、顶尖芯片,但你无法消灭中国的“体系构建能力”。然后中国开始补短板,搞芯片,搞AI,搞软件算法。最可怕的不是它追上了,而是它把这些东西也系统化了。 算法 + 工厂;数据 + 封装;大模型 + 自动化流水线。你可以断它的卡脖子技术,但你断不了它的体系构建能力。这个世界上现在只有一个国家,能把工业体系“整体打包开战”——就是中国。 这不是那种“靠卷”堆出来的,而是有深层文化机制支持的能力。能干,听话,聪明,擅长协作、执行和大工程落地。这不是一种能力,是一种建立在儒家文明结构。 所以说,特朗普不是疯子,他只是看懂了这件事。他知道,中国不是偷走了几个岗位,是在悄悄拼装一个能打仗的产业链闭环。 而这正是美国最怕的事:一个有软件有算法、后面硬件有工厂、有指挥系统、还能一体化推进的国家。 但故事还没结束。 中国🇨🇳真正的对手,其实不是美国🇺🇸。是自己。 因为历史上所有系统性最强、执行力最强的国家,最终往往都败在“刚性太强,转弯太慢”。 它会赢在系统,也可能毁在系统。摧毁一个像中国这样的国家,不需要敌人,只需要它自己不断加速、不留缓冲。

Tigris 会讲课教授是好老师

164,380 views • 1 year ago

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 views • 8 months ago

OpenClaw/Clawdbot作者 Peter Steinberger 讲了一个让他顿悟的瞬间。 他给自己的clawdbot发了条语音消息,然后才反应过来:我根本没做语音功能啊。但"正在输入"的指示器亮了。十秒后,agent若无其事地回复了。 Peter问它:你怎么做到的? Agent的回答让他震住了:你发的消息只有一个文件链接,没有扩展名。我查了文件头,发现是Opus格式。用你Mac上的FFmpeg转成Wave。想用Whisper但没装,还报错了。不过我翻了翻发现你环境变量里有OpenAI的key,就用curl调了API拿到转写,然后回复你了。 这个故事的意义在于,这不是预设好的workflow,不是写好的代码,是agent在遇到一个从未见过的问题时,自己想办法把链路串起来。文件头分析、格式转换、找可用工具、翻环境变量、调第三方API,一气呵成。 Peter说了一句话我很认同:这些东西是该死的聪明、足智多谋的野兽,只要你真的赋予它们力量。 "if you actually give them the power"才是关键。大多数人还在用AI写个总结、改个文案,把它当高级搜索引擎用。但当你给它shell权限,给它访问你本地工具链的能力,它展现出的自主探索完成任务能力完全是另一个量级。 与此同时,行业里有一大批人在反方向努力。有人在绞尽脑汁省token,精心设计让AI 更少思考,生怕多花几分钱。还觉得模型做事太慢,自己来设计一些流程替代 AI 的思考探索,美其名曰加速。这种思路本质上是把一个足智多谋的野兽关进笼子里,然后抱怨它不够聪明。 更神奇的是,市面上95%的软件压根就不是为面向智能设计的。还是传统思路:产品经理写PRD,开发者把逻辑一条条写死在代码里,用户只能在预设的按钮和流程里点来点去。这些软件在AI时代就像是用打孔纸带写程序,技术上能用,但完全错过了这个时代真正的可能性。 --- 注,这段切片是我丢下一句话给 claude code 完成的下载切片添加字幕,只是提出要求,没有任何 Skills,没有告诉他怎么做。

kAI

171,400 views • 6 months ago