Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

兄弟们,我发现 Codex 改 Bug 最狠的玩法,不是让它直接修。 是先让它亲手证明:这个 Bug 真的存在。 直接把这段丢给它: “先别改源码。写一个最小测试把问题复现出来,运行给我看;找到根因后再修,然后重新跑同一个测试。” 跑完后,红的。 Codex找到问题改完,再跑一次,绿了。 这下codex他就不会嘴硬了。 有时候它会偷懒说“已经修复”,按照这个给他跑。 现在失败和通过全摆在屏幕上,它想嘴硬都不行。 这个对付codex偷懒小秘法我是百试百灵。 别只听它说好了,让它现场证明。

66,744 Aufrufe • vor 10 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

最近我用了 Grok Bot 一段时间,这是我最近最喜欢的 Agent 产品之一。 原因甚至不是 Grok 有多聪明。 是它真的有一台自己的电脑。 AI Agent 的最终形态,其实就是给 AI 发一台电脑。 xAI 给 Grok Bot 配了一台持续存在的云电脑,里面有浏览器、文件系统和终端。登录状态、文件、浏览器 Session 都会留下来,你把电脑关了,它也可以继续干活。 听起来只是一个产品功能,实际用起来,我觉得它把 Agent 的体验往前推了一大截。 比如我每天都要刷 X。 以前让我用 AI 帮忙看 X,工作流通常是这样的: 我刷到一条东西,复制给 AI;AI 觉得有意思,我再去找原帖;再开几个链接;再把资料复制回来;让它查证;最后再让它帮我写。 AI 干了很多活,但真正操作互联网的那个人一直是我。 Grok Bot 让我第一次很自然地把这部分也扔掉了。 我直接在它那台电脑上把 X 登录好,然后告诉它去刷我的 timeline,看看今天大家在讨论什么,发现有意思的东西就点进去,把原帖、引用、相关讨论都看一遍,再去外面查资料,最后觉得值得写的,帮我整理成帖子。 它就真的去操作浏览器了。 网页没有 API 没关系,没有 MCP 也没关系。只要人能打开网页、登录、点击,它就有机会自己完成。xAI 自己对 Grok Bot 的定义其实也很明确,它可以登录并使用网站和 App,用 computer use 处理那些没有干净 API 的软件。 这才是 Agent 真正重要的一步。 过去一年大家一直在给 Agent 加工具,Search、Browser、Code、MCP、Connector… 工具越来越多,可我的体验经常还是我才是所有 Agent 背后那个最累的 Agent。 我同时开着好几个 AI。这个查资料,那个写代码,另一个做图,还有一个跑 Deep Research。 A 做完以后我复制给 B,B 做完以后再扔给 C。 名义上我有一支 AI 团队,实际上我是这支团队里专门负责复制粘贴、开网页和催进度的项目经理。 Grok Bot 有一个特别戳我的能力**,它甚至可以去操作另一个 Agent。** 我可以在它的浏览器里登录其他 AI 产品,然后告诉 Grok Bot 这个任务你去交给它。 等它跑完,把结果拿回来,然后继续完成后面的事情。 到这里整个关系就开始发生变化了。 以前是我管理五个 Agent。 现在我开始尝试只管理一个 Agent,然后让它去管理剩下几个。 而 Grok Bot 本身也支持多个 Bot 协作,它们可以互相发消息、传递上下文、交接任务,同时共享用户的云电脑、文件和登录状态。 我觉得这才是真正让我兴奋的地方。 过去我们把 Agent 想成一个会调用很多工具的模型。Grok Bot 给我的感觉,更像是第一次给 AI 分了一张办公桌。 电脑在那,账号在那,浏览器开着。有什么事情直接发消息给它,它自己去开网页、找东西、操作软件、叫别的 Agent 干活。 这和在聊天框下面再塞十个按钮,完全是两种产品感受。 只要 Agent 真正获得了电脑,它能接管的就不再是一两个 AI 功能,而是今天已经存在的整个软件世界。 几十年来所有软件,最终都默认一个前提是屏幕前坐着一个人。 现在这个人,第一次可以不是我了。

sleepy.md

21,551 Aufrufe • vor 10 Tagen

一周 $1,400,000 标的只有一个:伊朗 他的主页在这: 你怎么在不预测任何结果的情况下赚 $1M? 答案只有一句话: 用 $0.94 买 $1 三天前我装了 ClawdBot 最近所有人都在吹它,我原本以为又是一个被神化的工具 结果它在 24 小时内,帮我找到一个单日印 $300K的钱包 事情是这样发生的 我给 ClawdBot 的任务非常简单: 在 Polymarket 里找不符合人类直觉的盈利模式 异常的、反常的、数学上说不通的那种 先说一句感受: 这东西不像工具,更像一个真的在“帮你做事”的助手 开源、免费、几分钟装好 但真正离谱的是—— 它能直接操作你的电脑 读文件、搜网页、修自己 bug 我让它连 Telegram,一开始失败了 它自己去看日志,找到问题,然后——自己修好了 我什么都没动 我说要联网搜索 它只回我一句: 给我一个 Brave Search API key,其它我来 我把 key 给它 它自己完成了所有连接 没有配置文件,没有手动步骤 那一刻的感觉是: 你不是在“用软件”,你是在跟一个真正想帮你赚钱的东西说话 好了,回到那个钱包 ClawdBot 返回了一个地址,我滑到它的时候,手停住了 同一个市场: “美国是否在 X 日期前打击伊朗” 他反复进 同一题目,30 多次 7 天 总利润:$1,017,000 我第一反应是: 系统 bug 我查了链上记录 是真钱 是真成交 我把他所有交易拉进 Excel,整整看了 3 个小时 然后我终于明白一件事: 他根本不在乎美国会不会打伊朗 结果,对他来说是无关变量 他在做的只有一件事: 套利 你还记得上学时那种故事吗? 有人发现自动贩卖机偶尔会掉两瓶可乐 围观的人都以为是运气 其实只是—— 机器的数学坏了 Polymarket 里,全是这种坏掉的贩卖机 用最白话的话说他的策略: 同一个事件,Polymarket 会开很多不同时间的市场: 美国是否在 3 月前打伊朗 美国是否在 4 月前打伊朗 美国是否在 6 月前打伊朗 如果 3 月发生了,4 月和 6 月的 YES 也会结算 但问题是—— 这些价格经常算不明白 有时候,你可以买下多个日期的 NO,总成本只有 $0.94 如果什么都没发生 → 你拿 $1 如果真的发生了 → 仍然至少有一个 NO 结算 不管发生什么: 你赢 不是预测 是算账 $0.94 买 $1 这就是全部逻辑 他一周这样做 30 多次 同样的结构 同样的数学错误 同样的利润 $300,000 / 24 小时 此时再画趋势线,看起来多少有点尴尬 我后来总结了他轮流用的 5 套套利结构: 1|基础套利 同一市场同时买 YES + NO 总成本 $0.96 必然有一个结算 $1 → 无风险 4% 2|互斥事件套利 两个不可能同时成立的事件 YES 全买,总价 < $1 → 必有一个赢 3|矛盾套利 两个市场互相否定 一个买 YES,一个买 NO → 市场自相矛盾,你吃价差 4|多选一套利(他最常用) 多个结果 对其中多个买 NO 只要发生一个,其它 NO 结算 → 从“必然性”里赚钱 5|必然发生套利 买下所有可能发生的 YES 只要总成本 < $1 → 白送钱 预测是赌博 套利是会计 这件事真正改变我的是: 我在 Polymarket 混了几个月 看辩论、读民调、试图比市场聪明 这个人,完全无视信息 他只找一个问题: 这里的数学是不是坏了? 而答案是: 每天都在坏 ClawdBot 还给我看了另一件事 它现在可以主动工作: 监控钱包、盯市场、 一有套利窗口,直接通知 我让它追踪这个交易员 现在他每次进场,我 Telegram 都会响 昨晚 2:47 提示来了: US strikes Iran by April NO @ $0.89 我当时没看懂 去查其它日期市场 所有 NO 加起来: $0.91 确定性 $1 9% 回报 零预测 我跟了一单 今天醒来: + $340 不改变人生 但我什么都没预测 什么都没分析 我只是—— 照着数学抄 现在有 23,000 人在 watch 这个钱包 大多数人还在猜: 美国到底会不会动手 他们在下棋 而他在数棋盘,发现多摆了几颗卒子 现在 Polymarket 上,关于同一地缘事件、不同时间的市场,至少还有 12 个 它们的价格,依然算不到 $1 免费的钱,就藏在那个缝里 而这个交易员,大概率现在已经进场了 两条路: 继续预测 继续分析 继续把钱交给找到“坏贩卖机”的人 或者—— 学会这 5 套结构,找出数学错误,开始收钱 套利不是更聪明 只是发现: $1 正在打 94 折 折扣什么时候结束? 当足够多人注意到的时候 你,今天看价格了吗?

0x_Miko

49,672 Aufrufe • vor 7 Monaten

兄弟们,最近世界杯打得火热,想尝试让不同的AI模型帮我分析一下“目前最有可能夺冠的是谁?” 先登场的是Claude Opus 4.8和ChatGPT 5.5(视频一)。 GPT 5.5还算中规中矩预测的是法国队,不过Opus 4.8让我有点意外居然是西班牙。 然后我看了一下他们的预测依据,我怎么感觉Opus 4.8不太靠谱呢?我这开了网络搜索啊,它难道不知道西班牙开局不利吗?这因素都没考虑进去不应该啊。 我又找了个大佬推荐的专门搞深度研究的AI产品:Apodex Apodex 它硬是给我跑出了一篇带 8 个权威信源的小论文,我把它的回答也发出来了,你们感受一下这个差距(视频二)。 它没有直接给答案,而是先干了一件让我很惊讶的事: 1/ 自己去查了 Opta 超级电脑的 2.5 万次模拟结果,告诉我法国原本夺冠概率 13%,仅次于西班牙。然后它又实时扒了最新博彩赔率,发现开赛后法国已经变成“独立第一热门”,赔率 +410。 2/ 这还没完,它怕我被数据忽悠,又去交叉验证了《纽约时报》、BBC、Fox Sports 的多篇战报,甚至扒出了姆巴佩本赛季 47 场 49 球的恐怖数据,以及英格兰后防线谁又伤了…… 3/ 最后连西班牙被佛得角逼平导致淘汰赛路径变难的连锁反应都给我推演了出来。 相比一些AI的“伪正确”(一本正经的胡说八道), Apodex 的每一条结论,都敢把原始信源亮出来让你点开查证。 它不是会聊天的嘴替,它是真的能帮你去发现那些还没人替你整理好的复杂真相。 以后谁敢再跟你空口预测冠军,你就把这截图甩过去:你的信源在哪?依据是什么? 感兴趣的可以去测试一下他们家的产品:

李岳

20,162 Aufrufe • vor 2 Monaten

这是上周在宾夕法尼亚州立监狱拍摄的。囚犯名叫David,正在服无期徒刑。他的狗是Max——一只十岁的黄色拉布拉多犬。David的母亲照顾Max九年了。她上个月去世了。Max必须被收养。 新家庭明天就要收养它。监狱牧师安排了最后一次探视。视频显示David坐在探视室的地板上等待。 紧张。门开了。Max和志愿者一起进来。Max看到David。猛冲过去。牵引绳掉了。跑起来。撞进David怀里。爪子搂住David的肩膀。两人倒在地板上。 David抽泣着。抱着Max。“对不起。 对不起!我不能再养你了。你要去一个好家庭了。你会幸福的。” Max舔着David的脸。它不明白。以为他们要一起回家。David有三十分钟时间。整个时间都抱着Max。和它说话。感谢它。告诉它自己爱它。时间到了。David不得不放手。站起来。Max试图跟着。 志愿者拿起牵引绳。David走向门口。回头看。Max在拉。试图够到David。David后来通过电话告诉我们:“那是我最后一次见Max了。 它明天就要被收养了。我有无期徒刑。Max老了。我再也不会见到它了。 但我得以告别。告诉它我爱它。这就是我需要的全部。”Max被收养了。家庭把照片发给牧师,牧师给David看了。Max在新家。安全。 被爱着。David说:“这就是最重要的。 Max很幸福。这就够了。”有时告别是永久的,但你仍然有三十分钟时间说完所有重要的话。​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​ ——AI电子榨菜非虚构写作

Elsinore

73,907 Aufrufe • vor 21 Tagen

我让 AI 找一个值得做的产品,它盯上了律师账单里的 6 分钟 最近用 AI 做产品调研时,我越来越明显地感觉到一个问题: 信息并不缺,缺的是判断。 问“下一个 AI 机会在哪里”,很容易得到一长串听起来都对的答案:AI 法务、AI 财务、AI 营销、AI 编程…… 但真正准备行动时,还是不知道哪个需求真实存在,哪个只是被反复包装的趋势。 所以这次我换了一种问法。 我让 AI 从用户抱怨、产品评论、GitHub Issues、行业报告和现有产品中寻找信号。每提出一个方向,还必须主动寻找反证:竞争太强、付费意愿不足,或者已经有成熟工具解决,就淘汰。 它一共比较了12个方向。 广告上线前 QA 的损失很直接,但链接和落地页检查已经有成熟工具;AI 代码审计的痛点很强,但市场拥挤,而且人仍然可能需要逐行复核;财务对账高频,却绕不开数据权限和“到底以哪个系统为准”的问题。 最后留下的,是一个我原本完全没有想到的场景: 律师的工时记录与账单叙事(比如美国的法律服务)。 许多按小时计费的律师以0.1小时,也就是6分钟为单位记账。会议、邮件、电话和文档修改结束后,他们还要回忆自己做过什么、匹配案件、补记时间,再把记录改成客户能够接受的账单描述。 AI 在这里不需要替律师做法律判断。 它只需要把日历、邮件和文档活动整理成带来源的候选记录,再由律师确认、修改或删除。 它真正解决的也不是“写得更快”,而是减少漏记、降低审核返工,并让每条收费描述都有依据。 这次测试用的是 Apodex。它里面的 Deep Discover 最让我意外的地方,不是能生成多少想法,而是会主动反驳自己的想法,把一个宽泛的问题逐步收敛成可以验证的假设。 它也没有把这个结果包装成确定的创业机会,而是给出了一套30天验证方案:访谈律师和 billing manager,用脱敏样本测试草稿编辑时间,再验证是否真的有人愿意进入付费试点。 如果律师不愿开放数据、修改草稿和自己重写一样费时,或者现有软件已经够用,那这个方向就应该停止。 我觉得这才是这次测试最有价值的地方。 它没有替我宣布一个答案,而是帮我排除了一批看起来正确的答案,最后告诉我: 下一步最值得验证什么,以及出现什么结果时应该放弃。 有时候,真正有用的 AI 不是让人更快得到结论,而是让一个模糊的问题,终于有了可以行动的下一步。 Open Source Harness: Open Weights: Website:

Ashlyn He

15,260 Aufrufe • vor 16 Tagen

很多人看 Inference Labs , 第一反应都是那些听起来特别硬的技术名词,比如什么 zkML,什么 PoI。 但说真的,如果你把这层技术的皮给剥开,你会发现它讲的根本不是代码,而是权力。 Inference Labs 真正做的,是把 AI 系统里以前那些模糊的权力关系,直接给拆散了摆在台面上。 在传统的 AI 世界里,模型方就是绝对的老大。 模型怎么跑,参数怎么调,最后给你一个结果,你除了相信,没有任何别的办法。 算力方也是一样,谁手里的机器多,谁的声音就大。这种结构下,用户其实是没有任何话语权的。 但 Inference Labs 正在把这套逻辑给彻底拆掉。 在它的 PoI 机制下,模型不再是那个不可挑战的上帝了。模型只能负责干活,负责给出推理结果,但它没有权利定义这个结果是不是对的。 一旦进了这个系统,模型的每一个输出都必须经过证明,经过别人的复现和验证。 这一步,本质上就是在削弱模型的权力。模型不再是权力的中心,它变成了一个纯粹的服务提供者。 再来看看算力。 很多人以为验证网络会让算力变得更值钱,更重要。其实恰恰相反,在 Inference Labs 的结构里,算力其实是被压制的。 算力在这里只负责执行任务,它不负责最后的裁决。你算得再快,机器堆得再多,你也改变不了结果的合法性。你没法靠着算力去强行说服系统接受一个错误的结果。 这意味着,算力在这里变成了一种商品化的成本,而不是一种能让你称王称霸的筹码。 那么,真正的权力流向哪儿了。 答案是验证者。 验证者不需要去训练什么顶级的模型,也不需要去买成千上万张显卡。 他们只做一件事,就是决定哪些推理是被系统承认的现实。这在现在的 AI 圈子里是非常罕见的设计。 它相当于承认了一点,AI 的问题其实不在于它聪不聪明,而在于当它给出结果的时候,谁有资格说这是一次有效的推理。 Inference Labs 把这个资格,从那些模型公司和平台手里,转移到了这个验证层。 这种变化的影响会非常深远。 以后在这个系统里,最强势的一方,不是那些最会训练模型的,也不是那些最有钱堆机器的。 而是那些能长期维持验证信誉的节点。这种节点看重的不是短期的那点博弈速度,而是长期的稳定性。 因为在它的规则里,只要你作恶一次,代价就是被系统永久边缘化。这种代价,任何想长久玩下去的人都承担不起。 所以我也一直在想,为什么 Inference Labs 在短期市场里显得这么安静。 其实道理很简单,这个系统里真正占便宜的角色,从来就不是那些会喊叙事,会搞投机的。 它奖励的是耐心,是持续不断的输出,以及永远不犯错的稳健。它天然地就在排斥那些只想进来薅一把就走的投机者。 我的感觉非常明确,Inference Labs 其实并不是在追求让 AI 变得更强,它是在尝试解决一个更有难度的问题。 那就是当 AI 已经足够强的时候,到底谁来约束它,谁来承担它产生后果后的责任。 在这个系统里,权力第一次不再是围绕着模型集中,而是被彻底拆散,被互相制衡。 这才是它最被低估的地方。 它在重新定义 AI 时代的规则。它告诉我们,在这个新的权力游戏里,诚实和稳定,才是最贵的资产。 #inference_labs #KAITO

比克大魔王

29,048 Aufrufe • vor 8 Monaten