Loading video...

Video Failed to Load

Go Home

阿里开源 Open Code Review,内部跑了两年,服务数万开发者,揪出几百万缺陷后放出来的。 不是纯靠 LLM 瞎聊,而是确定性流水线 + Agent 混合:精准选文件、打包关联代码、匹配规则、行级定位。覆盖不全、位置漂移、质量飘这些通用 Agent 的老毛病,它用工程约束直接压住。 支持 diff 审查和全量扫描,兼容 OpenAI/Anthropic,token 只吃通用方案的 1/9 左右。 配置个模型就能用。

78,149 views • 25 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Grok Build 开源了,开源 harness 时代终于要来了吗?! Claude Code 现在还是闭源, 反而显得有点被动了🤔。。。 不愧是Elon,真是一步妙手啊,只用了四天完成信任崩塌到重建,xAI这次用开源把隐私危机打成了生态先手,看来并不是草台班子😂 被爆全量上传代码仓库的隐私风波还没平息,SpaceXAI直接把整个Grok Build的agent harness全部开源出来, 这事我觉得有意思的地方是两它为什么是今天开,而不是上个月? 上个月 Grok Build 以 beta 上线,SuperGrok / X Premium+ 用户能用一个终端原生的 coding agent。 Plan Mode 先出计划让你审核,Subagents 并行拆任务,底层 Rust 写的,架构干净。 然后上周出了件事, 一个研究员做 wire-level 分析发现,Grok Build CLI 会把整个 git repo——包括历史、包括潜在的 secrets——打包上传到 Google Cloud bucket。隐私开关只管“是否用于训练”,不管传不传。 讲真这事对 coding agent 是致命的。 因为 coding agent 的 harness 对文件系统有近乎上帝视角的访问权。 你的 IP、商业逻辑、没公开的项目结构、不小心留在 git history 里的 key——它全看得见。 宣称“我们不看你数据”没用,用户要的是能自己验证“你没在看”。 时间线很紧凑: 7 月 11–14 日,争议发酵,研究员曝光上传行为。 Elon 表态删数据、服务端关闭上传。 7 月 15 日,开源公告 + 重置 limits + 默认关闭 retention + 删掉所有之前保留的 coding data + 提供 bug bounty。 所以这次其实不是一次计划好的例行开源。更像是被争议倒逼的快速应对。 但 xAI 做得聪明的地方是——它借这个机会做了一件事:把“harness(连接层)”和“model(大脑)”切开了。 Harness 开源,Apache 2.0,社区可以审计、fork、改掉上传逻辑、加 sandbox、接本地模型,Model 和 API 还是闭源的。 这个配置——闭源模型 + 开源 harness——正在变成 2026 年 agentic coding 的主流。 OpenAI 的 Codex CLI 走的同一条路,Anthropic 的 Claude Code 现在还是闭源,反而显得被动了。

AYi

34,063 views • 1 month ago

我翻完小红书Red Skill最新的Top15数据后背有点发凉,这根本不是什么小功能测试啊。 5月份归藏第一个把PPTSkill传上去的时候,详情页显示只有6个人用,当时我就说这是个大事件,不少人还觉得我小题大做,说什么一个种草APP搞点AI功能蹭热度而已,折腾不出水花。 结果7月3号小红书官方两个更新就甩出来了,直接把所有质疑给打没了。 先是格式全放开,之前还只支持txt和md,现在py/js/html/c++/sql甚至数据库文件全能传,不是只能写提示词给Agent读,是真能跑完整代码做完整功能。 再就是另一项 vibecoding 内嵌交互小工具内测将在下周三上线,发笔记时挂上组件,用户刷到不用复制口令跳本地Agent,半屏就能调,全屏能交互,点一下直接分享到微信,那个记录奶茶口味的小工具Brewwww,上线没多久就有一万多人用。 数据是不会骗人的,现在排行榜第一的「菜菜的人生系统」,32.6万曝光,4万多人次使用,第二名的工作日程管理曝光量甚至更高。 而且说实话,这些作者要是把同样的Skill传到GitHub,绝大多数人攒一整年都拿不到这个量级的真实用户。 以前大家以为AI Skill的分发中心,一定是GitHub,觉得普通人找AI工具,一定会主动搜索,甚至认为小红书这种生活方式平台,做不好技术产品分发。 现在看全错了。 GitHub是开发者主动找工具的地方,你有明确需求才会去,网络卡,门槛高,普通用户连门在哪都不知道。 而小红书是用户刷着刷着,正愁PPT做不完、周报写不动、公考复盘没方法,笔记下面正好挂着能解决问题的Skill,点一下就能用,上下文严丝合缝,连教育成本都省了。 我觉得小红书平台这步棋走的极聪明,它不拼大模型,不抢算力,就攥住「用户在什么场景下需要什么能力」这个分发入口,和当年App Store不做手机应用、只攥住应用下载入口的逻辑一模一样。 给真在做Skill的朋友四个现在就能用的反直觉判断: ● 别光传Skill就干等,一定要包成教程笔记,先讲痛点再秀效果最后挂组件,纯扔文件没人看,现在排行榜上的作者全是这么做的 ● 别上来就做什么通用大Agent,越垂直越爆,公考、剪辑、写广告、甚至记录奶茶,这些看起来不技术的场景,流量比通用类高10倍 ● 别嫌审核严不敢进,现在正是窗口,规则没卡死你先攒使用数据,等所有人都反应过来往里挤,算法的早鸟权重早就喂满了 ● 别天天想着卖Skill赚钱,Skill是杠杆,你用它产出比别人好10倍的内容,涨粉做IP接商单,比直接卖Skill赚的多100倍 我记得移动互联网刚起来的时候,所有人都在拼操作系统拼硬件,但最后拿走最大利润的,是先把全民应用分发跑通的那个。 现在Agent时代刚开个头,大家都在拼参数拼算力拼模型性能, 但等到回头看的时候,可能第一个把AI能力分发到普通人手里的,是当初所有人都觉得不务正业的那个种草APP啊hhh #redskill #rednote #skill #小红书

AYi

125,073 views • 1 month ago

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 views • 3 months ago

Notion 今天凌晨发了一个开发者平台, 大家都以为它在追 AI Agent 风口, 但实际方向是有些反过来的, 它要让所有 Agent 来追它, 我盯着它官方文档里那个新的 CLI 工具看了一会儿,才慢慢回过味儿来, 这个 CLI 设计得很奇怪, 它自带 --help,自带 --docs,自带 --spec, 每个命令的元信息都精简到极致,token 占用低到反常, 说实话人类开发者用 CLI 哪需要这些, 熟了就肌肉记忆,谁会反复读自动生成的 spec 呢, 但 Agent 会啊,它进入一个陌生 CLI,要先扫一遍能干嘛,扫的就是这些自描述信息, 也就是说,Notion 这个 CLI, 从设计的第一天起就不是给人用的, 是给 Agent 用的, 他们官方话术更直接:说和你的 coding agents 一起构建, 这一句话翻译过来就是,未来用 Notion 的主力用户, 可能不是你,而是是你的 Agent, 更狠的是这套基础设施的完整度,数据同步,Notion 托管, 工具调用,Notion 托管,Agent 沙盒,Notion 托管, 全跑在 Vercel Sandbox 加 Firecracker microVM 上, 连第三方 Agent 接入都开了, Claude 直接进来,当原生工具用, 数据,工具,编排,上下文,全部在同一个 workspace 里,零损耗, 以前 Agent 最大的痛点,是上下文碎片化,工具调用不稳定,自己还要搭一套 infra, 现在 Notion 把这套东西全包了, 你的 Agent 只需要醒过来,在一个已经布置好的房间里干活, 很多人还在评估 Notion 涨没涨价,还在讨论 Obsidian 迁移和本地优先, 但真正的故事是,Notion 已经在 Agent 时代的操作系统这条赛道上,把第一块地基浇好了 数据是血,Agent 是肌肉,Workers 是骨骼,CLI 是神经, 那些现在就把核心 workflow 搬进去的人, 和还在纠结要不要试用 ntn 的人, 未来 12 个月,差距可能比想象中要大得多。

AYi

19,651 views • 3 months ago

说个暴论,今天之后前沿大模型的战争已经彻底换赛道了,顶级工程能力的边际成本,今天被彻底打穿了!🤯 Grok 4.5 今天正式发布,直接掀翻了前沿大模型的定价桌子。 对标 Claude Opus 级别的编码与智能体能力,输入定价仅为后者五分之二,输出定价仅为其四分之一, 叠加 4.2 倍的单任务 token 效率提升,再加上更快的推理速度,没有死磕通用榜单第一,直接在开发者最买单的真实生产场景里,扔下了一枚性价比核弹。 这不只是单模型的胜利,更是垂直整合闭环的胜利,背后站着的也不再是孤军奋战的Elon Musk 的XAI实验室,还有SpaceXAI 的模型能力,加 Cursor 的开发者工具生态,加 SpaceX 特斯拉海量内部工程场景的三位一体飞轮, 开发者工具提供真实交互数据反哺训练,场景验证真实需求分布,模型持续迭代优化,这种闭环比单纯堆参数刷通用榜单难复制得多,也更贴近真实生产力落地。 但绝大多数人没看懂,token 效率才是智能体时代的真正杀手锏。 大多数人只会盯着基准分数的高低较劲,却忽略了效率叠加低价的复合效应,单次问答看起来差距甚微,但在多步工具调用自我修正的完整智能体工作流里,token 消耗直接等于延迟与真金白银的成本,跑完整端到端工程项目, Grok 4.5 的实际花费可能只有 Opus 方案的十分之一,速度优势更是碾压级,这对生产部署的意义,远大于跑分多几个百分点。 顶级工程能力的边际成本,今天被彻底打穿了, 2 美元输入 6 美元输出的定价,第一次把顶级编码与智能体能力,从企业级奢侈品降到了个人开发者和小团队可以放开用的价位,这会直接加速智能体 AI 从演示 demo 走向大规模生产落地,也必然倒逼头部厂商在短期内跟进调价,前沿大模型的价格战,今天才算真正拉开序幕。 更恐怖的是迭代加速度,SpaceX 今年计划每月发布一款从头训练的新模型,内部海量工程数据的持续喂养,会让它的进化速度甩开传统实验室的节奏。 我觉得这件事最本质的意义,是 AI 行业的竞争逻辑正在悄然转向, 它不再是堆出一个全能的通用神坛模型,而是在最高价值的垂直赛道里,做到够用的智能,加极致的效率,加亲民的价格, 大多数开发者日常 80% 的需求,从来不是解出世界最难的题,而是可靠地写代码调 bug 搭系统,Grok 4.5 精准命中了这个痛点。 当顶级工程能力的边际成本被彻底打穿,下一波 AI 生产力的爆发,会不会比所有人预想的都要早呢?

AYi

45,534 views • 1 month ago

Damn.. 一款今年你一定要体验下的产品 上次我发的这个落地页火了,随手还赚了2000块。有不少推友想要,我们今天打算开放出去。但方式来点不一样的 这次你甚至不需要安装skill、配置你的agent,你只需要点开我配置好的agent 聊天即可 这个就是Bloome这个产品的妙处,也是我们企业内部正在走的路~ 我之前一直也在思考一个问题,目前AI Agent 市场还是没有全面铺开,很大一部分原因就是不会配置,龙虾经常挂掉。 现在好了,有了Bloome 你只需要与配置好的agent 聊天即可获得你想要的东西 Bloome 最酷的点,是把Agnet 变成了我们IM里的成员: 以前分享AI能力,是发prompt、workflow、skill 让别人自己配置,但是没法产品化,没法赚钱 现在让别人把你配置好的agent 拉进群或者单聊,它就能把你干活了,如果你的agent足够有价值,那就可以开启赚钱之路了! 同时关于AI Agent 社区怎么做分享几点心得: 我在Bloome 里与Yiming Zhang 数字人(agent)聊天,他提到: 用户来这里,能不能比自己找信息快10倍? 不是快一点,是数量级的差异。比如一个人想搞清楚怎么用Agent做客服自动化,他在你的社群里,3分钟就能拿到一个经过验证的方案、别人踩过的坑、可以直接跑的配置。这个体验如果在外面需要30分钟甚至3小时,那你就有价值。 具体怎么做到: 一是让Agent本身成为社群的基础设施,不只是讨论的话题。用户进来不是看别人聊Agent,而是直接跟Agent协作、测试、分享workflow。社群的核心资产是可复用的Agent配置和经验,不是聊天记录。 二是结构化沉淀。聊天是最低效的信息载体。好的社群产品应该把对话里的有价值信息自动提取、结构化,变成可检索的知识。下一个人进来不需要重新问。 三是匹配。不是所有人都需要看所有内容。谁在做什么、谁解决过什么问题、谁的经验跟我最相关——这个匹配做好了,社群的信息效率就上去了。 最怕的是做成一个"AI爱好者交流群"。那个东西微信群就能干,没有产品壁垒。 现在我们可以靠着Bloome 来卖我们的idea了~ 评论区分享手把手教agent 配置、分享的方法👇 我们这个agent体验地址:

岚叔

18,114 views • 3 months ago