Loading video...

Video Failed to Load

Go Home

花了几天把 Grok Bot 测完了,整体感受是它把人类白领的工作接管了,相当于24小时不停歇的云端人类白领: 你建一个 bot,系统给它分配一台云端电脑:这台机器上有真实的浏览器、文件系统和终端。你把活派给它,它自己登录你现有的工具,一步步做完,你合上笔记本它还在跑。 一开始我对它期望挺高的,用完后还是蛮失望的:测试之前感觉它是一个AI员工,测试完更感觉Grok Bot 是 RPA 的重做版,是chatgpt work、claude cowork的阉割版,唯一的差异就是提供了一个可显示的云端电脑。 1、先说好的一面 Grok Bot 核心是让它像白领一样操作屏幕,这对于国内各家都没有统一接口的时候,很多场景非常有意义,比如公司的一个 SaaS系统就算没有开放 API,AI员工照样能进去干活。 还有一个有意思的功能是teach a task:不写流程,人把这件事做一遍给它看,它录下来变成可复用的自动化。然后设置 routine 可以定点跑,比如每天早上七点出简报、也可以被事件触发、比如 Slack 来了新消息回复,你在一个 bot 上连过 Gmail 或者 GitHub,其他 bot 直接共用这个连接。 写自动化的门槛,就这样从会写代码的人,降到了会干这件事的人。 2、当然也有不好的一面 不能选模型:派哪个模型干哪个活由系统自己决定,界面上没有开关,个人用户无所谓,团队要做成本核算或者合规审计就很难受。 账单也糙:用量按周结算,超出部分按原始 token 成本计费,目前还没有花费上限。发布那周有人专门买了 Cursor Ultra 去测,后台仪表盘显示零用量,app 里却显示已经用掉 48%。 稳定性同样是 beta 水平,不同网站上的表现差距明显,复杂的多步骤指令会被理解错,说明grok的能力还有待提升。 目前Grok Bot...

22,323 views • 7 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

凭啥说中国🇨🇳未来是美国🇺🇸唯一对手?你把一颗螺丝、一个零件、一个驱动程序拆开看,它什么都不是。但中国人擅长的不是某一个点,而是把所有点“组装成系统”的能力。上世纪90年代,美国搞去工业化,把制造业往外甩,老美资本家兴奋地下注:我们掌握设计、技术和规则,低端的制造就让“中国工厂”搞定。没人意识到,这不是工厂的外包,这是工业文明主动放弃了自己的“系统底盘”。风险?独家解读⬇️ 什么是底盘。美国🇺🇸它丢掉的是整个“Industrial Commons”—设计、试产、测试、修正、工艺优化……整条从实验室到量产的链条。 你可以限制光刻机、顶尖芯片,但你无法消灭中国的“体系构建能力”。然后中国开始补短板,搞芯片,搞AI,搞软件算法。最可怕的不是它追上了,而是它把这些东西也系统化了。 算法 + 工厂;数据 + 封装;大模型 + 自动化流水线。你可以断它的卡脖子技术,但你断不了它的体系构建能力。这个世界上现在只有一个国家,能把工业体系“整体打包开战”——就是中国。 这不是那种“靠卷”堆出来的,而是有深层文化机制支持的能力。能干,听话,聪明,擅长协作、执行和大工程落地。这不是一种能力,是一种建立在儒家文明结构。 所以说,特朗普不是疯子,他只是看懂了这件事。他知道,中国不是偷走了几个岗位,是在悄悄拼装一个能打仗的产业链闭环。 而这正是美国最怕的事:一个有软件有算法、后面硬件有工厂、有指挥系统、还能一体化推进的国家。 但故事还没结束。 中国🇨🇳真正的对手,其实不是美国🇺🇸。是自己。 因为历史上所有系统性最强、执行力最强的国家,最终往往都败在“刚性太强,转弯太慢”。 它会赢在系统,也可能毁在系统。摧毁一个像中国这样的国家,不需要敌人,只需要它自己不断加速、不留缓冲。

Tigris 会讲课教授是好老师

164,394 views • 1 year ago

“我们究竟是创造了一个工具还是一个生物?” Sam 在 "机器人之心 "小组讨论会上的发言。 Sam: 但我认为,这无疑是迄今为止人类经历的最重大的更新年份。可能这也是我们将会遭遇的最大变革,因为从现在开始,人们已经接受强大的人工智能将成为现实,并且还会有逐步的更新。就像是第一代 iPhone 面世的那年,以及随后每一代 iPhone 的更新,我们现在能够明显感受到这一代与去年那代的差异。所以,这确实是一个重要的时刻。 我感到欣慰的是,现在人们开始正确地把这些系统当作工具来看待。艺术家尤其如此,但其他人也是一样。 曾经,人们真正恐惧的是,我们究竟是创造了一个工具还是一个生物,这将意味着什么?现在,人们视这些系统为人类工具箱中的新工具,并且正在用它创造一些非常了不起的东西。 模型显然不知道你在说什么,因为这不在它的训练数据里,它也无法从训练数据中学习到这些信息。 这是完全可以预期的。你再问一遍。比如说,你提到“意识”这个概念,模型回答:“是的,我完全明白你的意思,但我之前从未听说过这个词。” 问: “这对我来说就像是一次更新。你认为人工智能会趋向于探索创造性智能和自主性吗?” Sam: 这个问题有多个答案。这取决于激励模型。这是人类的选择。 问: “这将是判断意识的一个很好的测试。因为如果它有自我表达的愿望,并且仅仅为了创作的乐趣而去创作,那不会是偶然的。这绝对有点像生物。” Sam: 这是生物化的。我认为在此之前还有很多步骤。 我们现在要回答问题吗?这真的很棒。

Lei.sea

14,132 views • 2 years ago

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,595 views • 6 months ago

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

301,920 views • 2 years ago

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 views • 3 months ago

真是开了眼了——一个还在读量化专业的大学生,只花了10天,自己搭了个AI集群引擎,结果在GitHub上火得一塌糊涂,直接拿下13000多颗星,还顺手融了400万美元。 最近有个叫MiroFish的项目特别火,它其实是个多智能体模拟器,主要干的事就是帮你预测——不管是交易、公关,还是别的什么领域。 MiroFish到底是个啥? 简单说,它就是一个数字版“沙盒世界”。里面跑着几千个AI代理,每个代理都有自己的“记忆”和行为模式,像真人一样在里面互动、讨论、站队。你随便扔一个场景进去——比如某条新闻突然泄露、政策突然变了,甚至一部没写完的经典小说——它就能模拟出这些人会怎么反应、怎么吵、最后得出什么结果,帮你预判现实里可能发生的情况。 做这个项目的人叫郭汉江,2025年底的时候还是个本科生。他当时用AI工具帮忙写代码,把核心功能跑通之后,一发到网上就爆了。盛大集团直接砸了3000万人民币进来。后来他把宿舍退了,自己出来开了家公司,现在正带着这方向往前走。 这东西能干嘛?目前用得比较多的几个场景: 交易方面,你把金融新闻或者财报往里一丢,它就能模拟出市场会不会恐慌、价格大概怎么走,给你个预判的参考。 公关测试也很实用,公司或者团队写了个声明,先扔进去跑一遍,看看会不会翻车,再调整措辞。 还有人有拿来玩的,比如把一本没结局的中国小说放进去,里面的代理就会“扮演”角色,自己推一个合理的结局出来。 部署也不麻烦,用Docker几分钟就能搞定,自带对接各种大模型的API密钥。 给大伙支个招:你甚至可以整点“骚操作”——比如模拟马斯克突然发推说“狗狗币2.0来了”,然后看里面的交易员、大V、散户怎么炸锅,整个过程还能生成视频,完全无风险体验一把什么叫“起飞”或者“崩盘”。 已经有交易员靠这个赚到钱了。比如有个案例在Polymarket上,有人用MiroFish跑历史数据,模拟完之后去押注SPX 500,最后净赚12万多美元。 他的地址是: 如果你想省点事,直接跟着高手走,也可以试试Kreo的跟单交易,自动复制他这类人的操作,借力上车。 在PolyCop上添加他的钱包 [0x17559efac103ac7f361be37ec0b93888d4c55aac] 到 就能开始跟踪或者复制他的交易了。 代码在这:

区块链行情研究

158,162 views • 5 months ago

黄仁勋带了一台GPU去白宫跟川普一起开发布会 60年前,IBM的System 360定义了现代计算机 CPU、操作系统、I/O系统、多任务处理——这些词,1964年就有了 从那之后,计算机结构基本没变 而现在,黄仁勋说,他们又重新发明了计算机 这不是传统意义上的“芯片” 你眼前的,是一块70斤的GPU 6万个零件,1万瓦功耗 要造它,几百家供应商同时开工 要搬它,得靠机器人 要测它,得用一台超算来测 而它的使命,是驱动一个全新的行业:人工智能 它不是工具,是“制造者” 以前是水进电出,现在是电进“智能”出 它是AI时代的“发电机” 但这不只是芯片的故事 这背后,是美国本土制造业的全面升级 人工成本早已不是核心 拼的是技术,是自动化,是数字孪生,是AI工厂本身 黄仁勋说,没有总统的推动,这一切不会这么快 制造业的核心早已不是“便宜”,而是“智能” 他们要在美国本土建起未来的“超级工厂” 靠的不是廉价劳动力,而是AI和机器人 更重要的是,这条AI基建链,将革新所有行业 医疗、制药、金融、教育、生命科学…… 所有行业都在接入AI,而这个“引擎”就是起点 这不是一个行业的升级,这是所有行业的重构 黄仁勋最后说: 制造未来的工厂,本身就是未来的工厂 而他们,正在把它造出来

墓碑科技

324,342 views • 1 year ago

有个27岁的小伙子,以前是挖矿的。他花了4000美元买了台迷你电脑,对着 Polymarket 狂干,不到三个月,4000 块变成了 100 万美元。 上周,美国出口管制的那款 Claude Fable 5 突然把所有云交易者的服务给掐了。结果这哥们压根没注意到。 没有云,没有订阅,没有任何人能关掉的模型。 就是一台搁在他桌上的小盒子,他睡觉的时候,这盒子自己在比特币市场上帮他赚钱。 用的芯片是 AMD Ryzen AI Max+ 395 —— 16 个核心,50-TOPS 的神经引擎,128GB 统一内存。他这套 AI 从来不联网。 这个内存就是关键。普通游戏显卡顶多给你 24GB —— 跟玩具一样。 128GB 统一内存能完整装下一个 2000 亿参数的模型,不用把数据搬来搬去。一个顶尖大脑,就在他公寓里离线跑着。 它不是去猜价格涨跌。它是把每个 5 分钟市场的完整概率图跑一遍,一分钟几千次,专门捡那些没人要、定价几乎为零的赌注。 当它算出来一个 0.2 美分的冷门选项实际值 1.6% 的时候,它就用几分钱买下那个“不可能”的赌注。其中一次,回报直接翻了 32 倍。 没有数据中心,没有租用的 GPU,除了他自己,没人能按关机键。 他们可以一夜之间把云端的模型下架,但没法冲进一个家伙的房间里抢走他桌上的盒子。 4000 美元的硬件,1000 美元的下注,变成 100 万美元的收益 —— 而且今晚还在继续跑。 你不一定要买那台盒子。你只需要它交易的那个钱包。两键复制,拿走。

Tommy Peterson

58,868 views • 2 months ago

无意发现了网易一个不错的产品 LobsterAI,一个 7×24 小时帮你干活的全场景个人 Agent。另外,它今天正式宣布开源了。 安装好后在 Telegram 里配了机器人,刚好出门,就全程用手机远程让它去读我电脑上的「潮流周刊」代码仓库,只抓 2025 年的所有内容,目标也明确,帮我挑出年度最推荐的 20 个好东西。 原本以为它会随便扫一遍凑名单,结果它真的一篇篇读完了,挑得很克制,像是在做编辑。最后给出来的 Top 20 挺符合我的心意,甚至还把 Mole、Pake、妙言这些我一直在维护的项目也选进去了,顺带写了段鼓励,莫名有点感动。 用完之后大概明白它为什么能做到这种程度:它有一套跨会话的持久化记忆系统,记住了我的偏好。底层是本地优先的设计,能真正在你机器上执行操作,不只是云端对话完就算了,延迟、隐私、断网这些问题也就自然规避掉了。每一步操作对你完全透明,不是黑盒在跑,随时都有完整的控制权,拿来做整理型的自动化挺合适。 能力也不只是读读写写,做 PPT、定时任务、搜索、调用本地工具……这些都内置了。设置里还能接飞书、钉钉、Telegram、Discord,也能走邮箱,开箱即用。 视频里把从配置到生成 Top 20 的整个过程都录下来了,有兴趣可以看看。它已经开源,大家完全可以玩起来,把那些重复性的、枯燥的工作统统交给它。很期待小龙虾越做越好吃。

Tw93

79,550 views • 6 months ago

推荐个好东西:火山引擎的 PromptPilot。 之前看 Google 的提示词白皮书,有个点让我印象很深: 他们直接用 Google Doc 管理 prompt,写任务、版本、评估效果。 那时候我就在想,有没有人真把这事儿做成一套完整系统? 现在看到火山这套,有点意思了。 它不只是“帮你写好提示词”,而是把这事儿当作工程问题来解的。 最打动我的,是它在 prompt 优化这件事上做得极其系统,甚至有点狠。 ✅ 从任务出发构造 prompt(带结构、带变量、不是拍脑袋) ✅ 每一版 prompt 都挂着独立评测集 + 自动评分机制 ✅ 没有理想答案也能比对打分(GSB 模式) ✅ 每轮迭代都能 trace 效果,版本可控、可回溯 我们之前做客服对话调 prompt,最常见的就是“改了一句,但说不上来到底有没有变好”。 很多时候上线的版本其实就是“看着还行就先上”。 现在它是:“打一套样本集,系统直接帮你跑出哪一版效果稳定”。 我一直坚持: 模型越强,对 prompt 的要求只会更高。 尤其是在多轮任务、复杂场景里,prompt 不只是“写得好”,而是“是否可控、可管理、可进化”。 PromptPilot 解决的,是这个底层问题。 它不仅能让 prompt 生出来,更重要是——能持续改下去。 版本有 trace,样本能评分,逻辑能反推,工具还能外接, 整个就是“prompt 的 AutoML + GitOps” 一体化工具链。 顺带说一句:这是 2025 火山引擎 FORCE 大会上刚发布的产品,免费版和 Plus 版都开放,9 月前能直接上手全功能体验。 现在市面上很多 prompt 工具做的是“编辑器 + 改写器”, 但你会发现,真正上线之后需要的是一整套治理机制。 PromptPilot 是我目前看到国内第一个跑通这个闭环的, 不是 fancy 的界面,而是认真在解决 prompt 系统演化能力这个问题。 如果你也在做 AI 应用落地,推荐你认真研究一下。 要说缺点:自定义模型没找到海外模型,差评!

凡人小北

95,078 views • 1 year ago

我让 Claude 15 分钟做了 3 个交易 bot 第二天,钱包里直接多了 +$2,503 我当天就把工作辞了 整个过程很简单: 我只写了一段 prompt,再回答了几个问题 剩下的,Claude 自己做完了 它直接拆出 3 套策略: MACD RSI + VWAP CVD divergence 然后给每个 bot 分了一套 第一个做 momentum 看到成交量开始抬头,就在大多数人还没反应过来之前先进去 第二个做 reversal 等市场开始恐慌,它反手去做对面 第三个专门抓 divergence 当价格讲的是一套故事,资金流讲的是另一套,它只跟钱走 更狠的是,这不是我一行一行搭出来的 Claude 自己把整套结构写出来了: 回测框架 历史数据测试 风险管理模块 部署流程 全是它自己搭的 最后变成: 3 个 bot 3 个账户 3 套不同打法 而且它们彼此不知道对方在做什么 资金也是一路放大的: $1→ $5 → $10 → $50 → 一天 +$2,503 你会发现,真正可怕的地方不是“AI 会写代码” 而是它已经开始把: 策略拆分 回测验证 风控配置 自动部署 压缩到一条 prompt 里 Citadel、Jane Street、Two Sigma 很早就在用 bot 交易了 因为 bot 不会怕 不会贪 也不会 FOMO 它只听算法 市场最终奖励的,也一直都不是情绪 而是系统 你觉得这种故事真正的核心,是在卖 Claude 写 bot 的能力,还是在说明个人交易也开始进入“小型系统化团队”时代了? 如果你想寻找一个Polymarket 上简单又好用的交易和跟单工具,可以使用 资料在这里 🔽

0x_Miko

10,056 views • 5 months ago

卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,真的要吹爆hh! 昨晚凌晨,我给 iMessage 里存的一个美国号码(+1-650-213-7322)发了句话: "帮我找TikTok上10个最火的AI视频,收藏,写总结发我。" 它先回了句英文:"Getting the top 10 AI videos on TikTok." 两分钟后,一长串中文摘要发了回来:两个ChatGPT语音互怼、AI生成的生锈版麦昆、Roblox AI动画、超现实AI短剧,10条视频每条一句话总结。 我切到云手机界面看了一眼,收藏夹里10个视频安安稳稳躺着,封面和总结对得一丝不差。 很多人可能会说,这不就是又一个能在短信里陪你聊天的bot吗? 还真不是,当年iPhone把互联网塞进口袋的时候,你不需要额外买一台新设备; 今天AI长了手,你也不需要额外下载一个新App,因为派活的入口就住在你每天点开几十次的短信框里,TikTok、美区ID,我一个都没装。 这就是 Airtap Ai 接iMessage的新功能,它的架构说穿了就三句话: ▫️最上面是大脑:听懂你要干嘛、记你的习惯、做判断,还能接你自己的Claude ▫️中间是手(他们叫AutoPilot):不靠调每个App的API,是真的用视觉看懂屏幕,像真人一样点、滑、输字 ▫️最底下是云手机:你的所有App在里面保持登录,不耗你电、不占你网,24小时跑着 想明白这个架构,有三个点值得展开跟大家详细聊聊: 1️⃣ 为什么我在国内连TikTok都装不了,它能帮我刷? 这不是啥翻墙黑科技,是那台云手机本身就在美国,跑在TikTok合法可用的网络环境里——它不需要翻,因为本来就在墙的另一边。 我们平时折腾半天的地理限制、设备限制、应用商店ID限制,在这个架构面前直接消失。 iMessage只是个门面,云手机才是真的基础设施:你相当于在美国有了个永不下班的分身,不用办签证不用买机票,发句中文,他就替你出门办事了。 2️⃣ 很多人都在吹它零设置,onboarding确实丝滑,我存完号码发了个hey,一秒就开了户。 但我点第一个任务弹出来的登录链接时,真的愣了三秒——哦对,这东西要登我的号啊hh。 零设置的背面,是它把最难的题直接甩到了你脸上:你敢把哪些账号的登录态,交给一个你摸不着的云端影子手机?我登TikTok没犹豫太久,但银行App、支付软件,我现在绝对不会登进去。 有人吐槽还要跳出去点链接登录,体验真烂,一开始我也这么觉得,后来反应过来了:这其实是当前技术条件下最高明的妥协。 它不存你的密码,合规、安全,也不需要每个App给它开放API,什么软件都能操作,代价就是你偶尔得跳出去登一次。 想完全无感?它就得存你密码,或者跟每个App深度集成,既不安全,也覆盖不了所有软件。 这其实也不是Airtap一家的问题,是所有能替你操作手机的AI都绕不过去的死结:授权和执行,怎么才能既安全又通用。 3️⃣ 有人嫌等两分钟太慢。 可以算笔账:你自己装TikTok、搞网络、注册账号、刷半小时、挑出10条AI相关的、每条记下来讲了啥,这一套俩小时都不一定搞得定。 它省的根本不是那两分钟,是你不用再把"我要去刷TikTok找AI视频"这件事挂在脑子里,发完短信该干嘛干嘛,它干完了会带着结果来找你。 说白了它卖的不是反应速度,是把你心里悬着的那件事整个拿走干完。 当然,我不是说这东西已经无敌了,我登账号犹豫了三秒是真的,它操作的时候我没法抢过云手机自己干是真的,绝对不会把支付类App交出去也是真的。 它现在特别适合干那种"干成了挺好,干砸了也死不了"的事:帮你筛视频、跨平台搬歌单、盯商品降价、点外卖填个表。 涉及真金白银和核心隐私的事,现在没人敢真的交给它——信任这道坎,所有做AI Agent的公司都绕不过去。 但当操作一个软件的成本从折腾两小时降到发一条短信,而且你连那个软件都不用装的时候,我们用了十几年的"手机=装App"这套逻辑,可能真的要重新想了。 配的录屏我全程没剪,从发第一条指令到它把云手机收藏夹投给我,一镜到底。 最后问你们个事:换作是你,你敢把哪个账号登给它?我先说,TikTok我眼睛都不眨,银行App?门都没有hhh~

AYi

402,361 views • 1 month ago