Loading video...

Video Failed to Load

Go Home

今天好郁闷,发生了一点不愉快的事情!人生第一次为了自己的愚蠢进了叔所! 期待明天的好结果!!! ⸻ AI 的下一关,不在能力,而在可被证明 在模型规模不断被刷新纪录的阶段,有一个问题始终被刻意回避: AI 的结论,是否真的来自它声称的计算过程? Inference Labs 选择从这个问题切入。 他们关注的不是模型性能,而是推理行为本身是否可信、是否可复现、是否可审计。 Proof of Inference 的意义,在于把“我相信模型没问题”变成“模型必须给出证明”。 通过零知识证明,系统可以在不暴露模型结构和参数的前提下,确认一次推理: •确实由指定模型完成 •计算过程未被替换或篡改 •输出结果与真实推理一致 这不是提高透明度,而是引入约束。 在工程层面,DSperse 做的事情同样关键。 它把原本高度定制化、专家依赖的 zkML 开发流程,拆解为可复用组件, 使“可验证 AI”从研究范畴,进入实际应用范畴。 否则,再正确的理念也只能停留在白皮书。 目前,可验证推理在性能上的代价仍然明显, 但这更像早期加密系统的计算成本问题,而不是路线错误。 融资的用途,也正是针对这一层进行系统级优化。 如果说过去的 AI 竞争是“谁能算得更快”, 接下来的竞争,很可能是: 谁的推理能被证明、被追溯、被承担责任。 Inference Labs 所搭建的,不是价值观, 而是一层让 AI 输出进入现实系统所必需的验证基础设施。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

303,919 views • 8 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

最近 Miden 公布奖励后 明显大家怠慢了 Inference Labs ,没有前几天那么卷了,那我就开始冲啦。 很多人把 Inference Labs 当成一个 AI 基础设施,但我越看越觉得,它真正做的不是算力、不是模型、甚至不是验证本身。 它更像是在给 AI 世界搭一套司法系统。 现在大部分 AI 项目,都在解决一件事,怎么让模型更强、更快、更便宜。 但几乎没人认真回答另一个问题,如果 AI 的判断是错的,甚至是被操纵的,谁来否认它。 这不是一个技术问题,这是一个制度问题。 现实世界里,任何能影响结果的系统,都一定有一套否认机制。 金融有仲裁,法律有上诉,市场有清算。 但 AI 世界没有。 今天的 AI 输出,一旦被系统采用,就会一路向下执行。 自动清算、自动交易、自动风控、自动推荐。 问题不在于 AI 会不会犯错,而在于犯错之后,系统本身有没有能力说不。 Inference Labs 的位置,就在这里。 它不是在帮 AI 生成结果,而是在为结果提供一种可被挑战、可被回溯、可被否认的路径。 你可以把它理解成 AI 世界里的证据链,而不是算力层。 这一点很关键,因为它决定了 Inference Labs 真正的用户是谁。 它的核心用户,其实不是开发者。 开发者只是接入工具的人。 真正依赖它的,是那些已经被 AI 深度接管,却无法承担失误成本的系统。 比如 DeFi 协议。 AI 在里面做策略、做风控、做参数调节。 如果一次判断失误,损失是真实发生的。 但现在的系统里,几乎没有办法证明,这个结果到底是不是“按规则运行”得出来的。 DAO 也是一样。 越来越多的治理建议、预算分配、风险评估,开始交给 AI 辅助甚至直接决策。 但一旦结果被质疑,DAO 没有证据链可以审计,只能靠信任模型本身。 这就是 Inference Labs 的用武之地。 它并不是让 AI 更聪明,而是让系统在出现争议时,有一套可以站得住脚的说法。 这和 zk、算力、模型大小都没那么直接关系,而更接近制度建设。 如果你从这个角度看,就会发现 Inference Labs 的节奏和大多数 AI 项目完全不同。 它不追求用户爆发,不追求调用量暴涨,也不太在意短期热度。 因为这种系统,只有在规模足够大、风险足够真实的时候,才会被真正需要。 就像现实世界里的法院。 没人会天天夸法院多高效,但一旦没有它,秩序会立刻崩。 Inference Labs 服务的,其实是一群被动用户。 他们可能根本不知道自己在用这个协议。 他们只知道,自己的系统需要一个能够在关键时刻说清楚发生了什么的底层。 这也是为什么我认为 Inference Labs 很容易被低估。 它不制造爽点,只负责兜底。 而兜底型协议,在牛市里永远不性感,但在出事的时候,永远第一个被翻出来。 如果未来 AI 真正开始成为经济系统的一部分,那一定不是只有生成层和执行层。 中间一定需要一层,负责裁定、回溯、否认和问责。 从这个角度看,Inference Labs 更像是 AI 世界的制度组件,而不是工具组件。 而制度型基础设施,往往前期安静,后期不可替代。 这类项目,从来不是用来追热度的。 它们是用来活得最久的。 #KAITO #Inference

紫川 | ∞KIN |

12,423 views • 8 months ago

星爷讽刺了世间一切,唯独没有讽刺爱情,: 原来是如此的隐喻,到现在才明白,感谢星爷,只是我们弄脏了爱情。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。 懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。#KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 |上Gate玩事件合约

36,252 views • 9 months ago

你真的完全信任Ai吗? 如果AI 真要帮你进入交易、钱包、风控和链上执行时,你肯定会担心靠不靠谱。 现在大多数 AI 产品还是黑盒。 你输入一句话,它给你一个结果。中间调用了哪个模型、用了哪些数据、有没有被篡改、执行过程是不是真实发生过,用户基本看不到。 如果只是生成图片、写文章,出错了还能改。 但如果 AI Agent 以后开始帮你管理资产、执行交易、调用合约、判断项目风险,这个问题就不是体验问题,而是资金安全问题。 OpenGradient OpenGradient (∇, ∇) 要解决的就是这个问题。 它做的是可验证 AI 基础设施,让 AI 的推理过程和执行结果可以被证明,而不是只靠平台一句“相信我”。 对普通用户来说,它能解决几个具体问题: 第一,减少 AI 黑盒带来的不确定性。 以后 AI 给出交易建议、风控判断、链上执行结果,不只是给你一个答案,还能留下可验证的证明。用户可以知道这个结果不是凭空编的,也不是中间被人动过手脚。 第二,让 AI Agent 管理资产更安全。 AI Agent 如果未来要帮用户自动执行 DeFi 操作、管理钱包权限、处理交易任务,背后必须有一套能验证执行过程的系统。否则用户把资产权限交出去,本质上还是在赌平台不会出问题。 第三,降低开发者接入 AI 的成本。 OpenGradient 提供模型托管、可验证推理和链上证明能力,开发者不用自己搭一整套 AI 计算和验证系统,就能把 AI 能力接到链上应用里。 项目本身也是做到了打铁自身也够硬。 OpenGradient 已经托管了 4500 多个开源 AI 模型,处理过数百万次可验证推理,并生成了大量链上证明。融资方面,a16z crypto、Coinbase Ventures、SV Angel 等机构都参与过,团队成员背景也覆盖 Google、Amazon、NASA、Palantir 等公司和机构。 它的前景主要看 AI Agent 能不能真正走向资产场景。 如果 AI 只停留在聊天和内容生成,可验证推理的价值不会被完全放大。但只要 AI 开始接触交易、钱包、合约和现实任务,用户就一定会关心三件事:它有没有乱执行,结果能不能查,出问题能不能追溯。 这也是 OpenGradient 这类项目的机会。 AI + Crypto 后面不会只看谁会包装概念,真正能留下来的项目,大概率要能解决实际问题。可验证推理、可信执行、链上审计,都是 AI 进入金融和资产场景前绕不开的基础能力。 这次 $OPG 上线币安,也说明 Binance 对 AI + Crypto 基础设施方向还在持续加码。 对于 BNB Holder 来说,这次新一期的空投和 TGE 再次展现了 BNB 的底层入口价值。 现在持有 BNB 的权益正在从以前单纯的打新、手续费减免(现货和杠杆交易手续费低至 7.5 折),进一步升级为捕获早期 AI 核心基建红利的金铲子。 在这个阶段,与其在二级市场顶着高风险频繁换仓去搏一些短生命周期的项目,不如把 BNB 当作稳健的底仓配置。通过长期持仓持续吃足每一期生态发展的空投和赋能红利,拿稳生息资产带来的现金流,在不确定的市场里反而是确定性更高的玩法。 如果你本来就持有 BNB,可以关注后续 Binance Wallet 和 BNB 生态相关机会: 我的判断是,OpenGradient 这类项目看的不是短期热度,而是 AI Agent 以后进入资产世界时,市场到底需不需要一套可验证的执行基础设施。 如果这个需求成立,可验证 AI 会是 AI + Crypto 里绕不开的一环。

神币 🔶 馬良

22,142 views • 3 months ago

两个人不见面,不聊骚,不涉黄,不约会,不聊色的情况下,一个男的一个女的能聊多久? 我长期观察 Kindred Labs ,有了一个清晰的判断。 它真正想解决的不是 AI 像不像人,也不是 IP 会不会火,而是一个更底层的问题,IP 在数字世界里,第一次拥有完整生命周期的数据主权。 现在大多数 IP 的命运都很相似。 被创作 被传播 被消费 被平台吃掉数据。 用户的情绪 行为 偏好 和记忆,全都留在平台,IP 本身却什么都带不走。 Kindred Labs 的核心改变在于,它把 IP 从一次性内容,变成一个持续运行的系统。 这个系统不是靠曝光驱动,而是靠关系驱动。 SATO 只是第一个被完整跑通的样本。 真正重要的不是它是蚂蚁,而是它作为一个可持续存在的 AI 实体,每天在和用户产生可记录 可学习 可累积的数据关系。 这点非常关键。 因为一旦 IP 拥有了长期连续的数据轨迹,它就不再只是形象,而是具备了状态 演化 和历史。 这在传统 IP 体系里是不存在的。 从技术角度看,Kindred 在做的是三件事的叠加。 第1️⃣:IP 的行为层被模块化,所有互动不再是一次性调用,而是状态更新。 第2️⃣:用户关系被本地化,IP 不依赖平台推荐生存,而是存在于用户设备。 第3️⃣:数据权属被重新定义,IP 的成长轨迹是可验证 可迁移的。 这三件事组合起来,本质上是在为 IP 构建一个类似账户系统的存在形式。 不是账号,不是 NFT,而是一个可以持续运行的智能体。 这也是为什么我不把 Kindred 看成 AI 产品公司。 它更像是在搭建一个IP 的操作系统。 未来每一个进入 Kindred 的 IP,本质上都是在接入同一套运行环境。 从这个角度看,SATO 的经济设计反而只是外层。 真正的价值在于,Kindred 已经证明了一件事。 IP 可以不依赖平台流量,也可以持续存在并扩展关系。 这对内容产业意味着什么。 意味着未来 IP 的估值不再只看曝光,而会开始看留存 看互动深度 看生命周期长度。 而这些指标,只有在 Kindred 这种系统里才成立。 很多人把 Kindred 和其他 AI 项目放在一起对比,其实是错位的。 它不是在比模型能力,而是在重写 IP 的存在方式。 从长期建设的角度,我更关心的是下一步。 当更多 IP 进入这套系统,IP 之间是否会产生协作。 用户是否会开始把时间分配给不同智能体。 以及这些关系是否会反过来形成新的价值网络。 如果这些成立,Kindred 就不是一个爆款项目。 而是一条新的数字文明基础设施。 这也是我持续关注它的原因。 Kindred Labs #kindred #KAITO

比克大魔王

570,964 views • 8 months ago

现在满世界都在聊 AI。模型参数多大,算力芯片多贵,这种话题早就听腻了。 但大家似乎都刻意回避了一个最尴尬,也是最底层的事实。 如果一个 AI 代言你做了决定,或者直接替你操作了资金,最后出了差错,到底谁来负责。 在现在的现实世界里,这个问题其实已经开始有点失控了。 自动交易系统偶尔会莫名其妙地抽风。推荐算法在不停地误导用户的判断。 生成的内容里真假难辨。甚至在更严肃的医疗或者法律判断里,AI 的偏差也时有发生。现在的痛点从来不是 AI 会不会犯错。只要是程序,就一定会犯错。 真正的麻烦在于,当错误发生之后,现有的系统里根本没有任何结构可以去追责。 那些中心化的系统,给出的答案其实非常简单。 无非就是推卸责任,美其名欲说是系统升级,或者干脆直接删掉日志,当作什么都没发生。 但在一个由自主代理组成的未来世界里,这种做法是绝对行不通的。因为未来的 AI 不再只是一个问答对话框,它是要真正参与经济活动的个体。 Inference Labs 切入的角度非常有意思,也表现得很冷静。他们没有去跟风拼算力,也没有去卷模型性能。他们切入的是 AI 的责任结构。 他们有一个非常核心的假设。在未来,真正有价值的 AI,未必是那个智商最高的。而是那个可以向外界证明,自己到底做过什么的 AI。 这就是为什么他们搞的这套 Proof of Inference,本质上根本不是什么性能优化。它其实是一套在链上跑的问责机制。 当一个推理过程被证明确实执行过。当模型的运行路径可以被真实验证。当所有的结果都可以被第三方随时复查。这时候,AI 才算第一次具备了承担责任的能力。 这件事的意义,其实被现在的市场严重低估了。 因为只有当 AI 变得可以被追责,它才具备了进入高价值场景的入场券。如果没有这种透明的责任结构,你敢把成千上万的资金交给一个全自动的代理吗。 你敢让一个没有审计记录的 AI 去参与链上治理吗。你敢让企业级的风控系统完全交给一个黑盒吗。 没有问责能力的 AI,充其量只是一个好玩的电子玩具。只有具备了问责能力的 AI,才能真正踏入真实世界的金融和法律门槛。 Inference Labs 真正想构建的,其实是 AI 的责任层。他们不是要让 AI 跑得有多快。 他们是要让 AI 的每一步动作都留下无法抹除、无法抵赖的痕迹。 这也是为什么他们会选择先进入 Bittensor 生态。这不是为了蹭那点算力名气。 而是因为那里是第一个真正允许 AI 之间进行自主博弈、自主竞争的经济环境。 在那种 AI 开始真正参与经济活动的试验田里,一套清晰的责任结构,其实比模型提高那么一点点精度要重要得多。 这可能是一个很多人还没回过神来的拐点。大家还在沉迷于 AI 表现出来的聪明。 但 Inference Labs 已经开始在为 AI 的非理性行为修筑堤坝。这种踩点非常早,也显得非常老练。他们赌的是那个 AI 必须为自己行为负责的必然未来。 #inference_labs #KAITO

紫川 | ∞KIN |

12,124 views • 8 months ago

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

303,785 views • 2 years ago

印度正在干一件大事。 一件很安静,但可能影响深远的事。 他们在从零开始,构建一个梵语大语言模型。 梵语,是世界上最古老的结构化语言。 这个项目,不是简单的翻译工具。 更不是把古籍扫描数字化就完事了。 他们要让AI真正“学会”梵语,用梵语的逻辑去思考。 牵头的是一家有118年历史的梵语学院,和印度顶尖的理工学院IIT马德拉斯分校。 学者和数据科学家坐到了一起。 第一步,也是最难的一步,建立语料库。 他们收集了超过11万份梵文文本。 包括经文、孤本、还有数千份手稿。 为了处理这些古老的手稿,团队自己开发了专有软件。 结果惊人。 24小时内数字化了超过1000本梵语书籍。 每页只有三到四个错误,准确率接近97%。 梵语的语法结构极其复杂和精确。 比如“Sandhi”这种连音变化规则,还有复杂的词形变化,对AI的挑战远超英语。 解决这些难题,需要全新的算法和模型。 这暴露了一个关键问题。 当下的AI模型,本质上是基于英语世界的逻辑和数据结构建立的。 而印度这个项目,试图用一种完全不同的文明底层逻辑来训练AI。 这不仅仅是技术问题。 这关乎一个文明的记忆,能否在机器时代被完整保留,甚至被激活。 当全球科技巨头都在追求更大规模的模型、更快的算力时,印度选择了一条不同的路。 深度优先,而非规模。 结构优先,而非噪音。 意义优先,而非模仿。 这引出了一个更深层的问题。 AI的未来,是否也依赖于人类最古老的智慧? 如果这个实验成功,梵语将不再仅仅是被“保存”的遗产。 它将成为一种可计算的,具备严谨逻辑推理能力的工具。 这是一个国家在尝试用自己的文化之根,去定义自己的科技未来。 而不是被动地接受硅谷制定的标准和游戏规则。 这种对自己文明的自信和投入,值得深思。 当一个国家开始系统性地将自己的古典智慧与最前沿的科技结合,它的目标可能远不止是开发一个AI模型那么简单。

墓碑科技

22,272 views • 7 months ago

哥哥们你们太卷了,卷不过你们了,掉了30多个名额了哦!哭死了!哎!!! ——— 说实话,我一开始也是被 ZK 那一套讲法讲烦的。 什么数学优雅、终极信任、密码学圣杯,听多了真的会走神。 直到我在看 Inference Labs 的时候,脑子里突然冒出一个很不体面的画面: 这玩意儿怎么这么像拆熟食的? 传统 AI 给我的感觉,就像买一整块封装好的肉。 看起来油亮,切面也不错, 但你永远不知道里面有没有掺点别的。 你只能选择信,或者不用。 Inference Labs 干的事反而很“笨”: 它不让你信整块, 而是把 AI 推理一刀一刀拆开。 你不需要接受“这个模型很强”这种宏大叙事, 你只需要确认一件小事: 这一刀,是不是真的这么切的。 说实话,这个点戳到我了。 DSperse 那套分布式验证,说白了就是在帮人偷懒。 不是让所有人去理解整个模型, 而是让验证这件事本身变轻。 我不用背“我要为整个 AI 结果负责”的心理包袱, 我只关心我现在用到的这一小段推理, 有没有被乱来。 这在很多现实场景里太重要了。 医生、风控、合规, 没人有精力啃完整头猪。 更让我有好感的是,他们连“怎么验”都顺手简化了。 我是真的讨厌管理私钥。 不是不懂,是不想。 每次验证之前先来一套仪式感, 本身就已经在劝退人了。 和 Self Chain 的无密钥方案, 第一次看到的时候我心里是松了一口气的那种感觉: 哦,终于不是为难普通人了。 验证 AI,本来就不该比点外卖还复杂。 ⸻ 所以后来我发现, Inference Labs 干的事,其实挺不浪漫的。 它不讲终极信任, 也不喊改变世界, 只是很务实地把信任拆碎、摊平、递到你手里。 你想验,就验这一小块。 你不想理解,也没关系。 未来如果 AI 真开始翻车, 那些没法被拆、没法被验的模型, 大概真的会被永久挂在链上当反例。 我现在已经不太关心 “这是不是真正的 ZK 巅峰设计”了。 我更在意的是: 当我真的要用 AI 的那一刻,它有没有为我考虑过。 这一点上,Inference Labs 至少让我愿意继续看下去。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 MemeMax ⚡️ 🐬TermMax

27,155 views • 8 months ago

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,802 views • 1 month ago

好美啊!因为心中有你,所以每天都在想你,因为爱你,所以心中装满了你,喜欢你没有任何理由这辈子最自私的一件事,就是瞒着所有人偷偷的爱着你。有一种爱,不在身边,却在心间。愿你一切安好! ⸻ 刷到一条被疯狂转发的新闻: 英国一位 16 岁学生,用 LEGO MINDSTORMS 做出了可工作的拟人义肢手。 厉害是真的厉害,我也是真心佩服。 但这种故事我看得越多,越不太会被“天才”这个词打动。 因为它几乎总是伴随着一些被默认忽略的前提: 长期投入的家庭、很早就开始的工程训练、现成的工具和资源,还有被放大的传播环境。 这些东西凑在一起,能力出现其实并不意外。 反而让我更在意的是: 这只手之后会怎样? 能不能稳定使用? 是否符合安全和医疗标准? 它的控制逻辑,别人看不看得懂,能不能验证、复现、继续改? 当技术开始直接作用在身体和现实世界上,我对“感人故事”的耐心会变得很低。 因为一旦系统变成黑盒,出问题时是没有情绪可以兜底的。 AI 让个人能力变得更强,但也更容易把责任藏起来。 不可解释、不可验证、不可追责的系统,本质上只是把风险往后推。 也正因为这样,我能理解 inference 为什么会转发这类新闻。 他们真正关心的从来不是谁有多年轻、作品多惊艳, 而是:未来的工程师,究竟是在一个可被审计的世界里工作, 还是继续在不透明的系统上叠加复杂度。 对我来说,后者才决定技术会走向哪里。#KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐

201,751 views • 8 months ago