Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

一个印度小哥花半个月做了一只 AI 机器,成本不到700块 这只小家伙叫"核桃",别看便宜,功能一点不像玩具 首先走路不是预设动作,是用强化学习训练出来的。视频里左边电脑屏幕上能看到训练曲线和 3D 仿真画面——先在模拟环境里让它自己学怎么走,练几百万次,然后把模型部署到实体机器人上。走出来的步态很自然,不是那种机械的一抬一落 然后它有视觉感知。装了摄像头,画面右上角显示"Feeling Suspicious"和"MOVING"——它不只是能"看",还能根据环境变化产生状态反馈 最厉害的是接了大语言模型做语音交互。开发者跟它说 hello 它有反应,说 go back to sleep 然后把它按倒,它就真的趴下不动了 700块钱做出强化学习步态 + 语音交互 + 视觉感知,这个性价比太离谱了 宇树最便宜的机器狗也要大几千,波士顿动力那些更不用说。这个项目证明了具身智能的门槛正在被打到地板上

125,818 görüntüleme • 3 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

🔥AI搬回本地! $NVDA 黃仁勋剛剛宣布重大突破, 个人电脑迎来全新时代! ———————————— 过去四十年,一直是你在伺候电脑。 这一次,它要反过来。 我们这代人,是被机器训练大的。记快捷键,清后台,等进度条,文件存在哪个文件夹自己得记牢,我们学会的全是“迁就它”,把自己一点点训练得像台机器,它才肯好好干活。 所以黄仁勋这次最重要的东西,很多人看漏了。不是又一个开源模型,也不是新芯片的跑分。是 AI 要从云端“搬回家”,住进你这台本机里。 这两年我们用的 AI,说穿了都是“租来的大脑”。你得先把家底打包上传:合同、工资条、还没写完的东西、和家人的聊天记录。它在别人的机房里跑,按别人的价收钱,入口攥在别人手里。聪明是真聪明,可它始终不是你的,你只是个访客。 而“本地 Agent”这四个字的意思是:这些东西,终于可以留在你自己屋里了。不用上传,不用排队,不用看网速的脸色。它能看你的文件、懂你开着的软件、替你把那些零碎活儿干完。第一次,电脑不再是你点一下它动一下的工具,而是一个会自己动手的人。 为了这件事,老黄把数据中心级的算力,上百 GB 的统一内存、接近一个 petaflop 的性能,硬塞进了一台摆得上书桌的小机器。不是为了让你在本地跑个玩具模型,是为了让你桌上这台电脑,真有本事自己干活。 往大了说,棋局其实很清楚:云端那颗大脑,继续在数据中心里想最难的事;你桌上这台,负责手脚,管你每天的柴米油盐。而老黄想要的,是大脑和手脚,两头都攥在自己手里。 但我更想讲的,是那种很具体的感觉。PC 是上一代互联网的入口,手机是移动时代的入口。下一个入口不在某个网站里,就在你书桌上那台开机的电脑里。谁先住进去,谁拿下下一个十年。 所以他这次真正想说的,从来不是“我们出了块更强的芯片”。 而是过去四十年,你把自己训练得越来越像一台电脑。 从今往后,是电脑,开始学着像你请来的那个人。

老白

15,858 görüntüleme • 3 ay önce

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

37,185 görüntüleme • 20 gün önce

Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。

实践哥 Li

66,035 görüntüleme • 1 ay önce

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

16,224 görüntüleme • 4 ay önce

卧槽,最近发现一个强的有点离谱的 AI 团队。 96人的团队约 2/3 的研发成员是在校学生,博士、硕士、本科生都有,来自复旦、中科院软件所、中科院自动化所、人大、哈工大、华东师大等高校。 本来以为又是什么学生创业项目,结果顺着他们做的东西看下去,发现不太对劲。 他们做了一个 Agent 模型,叫 Atria Dawn Preview Atria ASI。 官网放出来的 Demo 一个比一个猛。 有科研和深度研究,有完整的软件项目,有交互作品和游戏,还有 3D 建模、CAD 机械结构。 重点不是让模型生成一张图或者一段代码。 而是让模型在一个真实环境里持续推进任务。 Atria Dawn Preview 面向科研、开发和专业工作,可以往下推进资料检索、写代码、调用工具、运行实验,再根据真实结果继续修改。 代码能不能跑,文件有没有生成,结果是否符合要求,也可以通过外部工具和环境继续验证。 看了一圈,我也拿了用它跑了个任务,因为之前9 月 12 日是世界急救日。 我就让它做一个 3D 海姆立克急救法互动学习页面。 就用大白话描述需求后,它开始拆任务、写代码、搭 3D 场景、做交互,再根据运行结果继续修改。 最后就是视频里的东西。 3D 人体模型、施救位置、操作步骤、动作演示都有,整个页面也可以直接操作和交互。 而一个完整的 3D 网页,恰好把 Agent 面对的另一类问题暴露了出来。 今天能力比较强的模型接上 Coding、搜索、文件系统和运行环境,都能完成相当复杂的任务。 真正难的,正在从能不能做,变成能不能稳定地做完。 一个复杂任务可能涉及几十甚至上百步操作。 前面查到的信息能不能被后面的步骤正确使用,代码报错后能不能恢复,工具返回意外结果会不会把整个任务带偏,最后的产物有没有经过独立验证。 任何一步出问题,都可能沿着任务链一路放大。 单步能力越来越强之后,长链路里的错误累积、状态保持和结果验证,反而变得越来越重要。 这也是 Atria Dawn Preview 比较强调 Harness、环境和 Verifiable Experience 的原因。 模型负责理解、推理和行动,Harness 负责维持目标、状态、上下文和错误恢复,环境则提供真实反馈和验证依据。 这套思路关注的已经不只是模型单次回答有多聪明。 而是把模型放进一个真实任务里,它能连续干多久,出错之后能不能拉回来,最后交付的结果又能不能被验证。 模型能力决定单步能走多聪明。 Agent 系统决定这些聪明的单步,能不能最终连成一个可靠的结果。 现在模型的单步能力已经卷得很高了。 AI下一阶段真正值得看的,可能就是谁能把这些能力稳定地串起来。

李岳

37,402 görüntüleme • 19 gün önce

我都已经开始想,OPC 以后会不会人手挂一个虚拟人直播间了。 这次社区的 OPC 在 xBubble xBubble 上 coding 出了一个实时虚拟人,Dappos DAPPOS 这段时间基本几天就能交付一个新 SOP,这个节奏确实有点夸张。 比较有意思的点是,这个东西不是给你看个 Demo 就结束了,它更像是一个可以直接拿来引用的虚拟人入口。 这次素材有亚洲、美洲、印度三个版本可以选,我个人会更偏向美洲版本,因为原形看起来更真实一点,放在直播、讲解、互动场景里,违和感会更低。 如果按这个 SOP 的思路走,其实上手路径不复杂: 先选一个虚拟人素材,下载后上传到 xBubble。 然后给它配置基础人设,比如它要讲什么内容、适合什么语气、面对用户问题怎么回应。 再把直播/语音/互动反馈这些能力接上,让它不只是站在那里,而是能根据内容实时说话、实时反应。 最后再根据你自己的场景去改脚本,比如项目讲解、直播控场、课程介绍、社区互动,甚至直接走抽象路线。 这才是我觉得它有意思的地方。 以前做虚拟人,很多人第一反应是成本高、门槛高、还要一堆技术配置。但现在 xBubble 把这套流程做成 SOP 后,社区 OPC 也能比较快地把一个实时虚拟人跑起来。 我都能想到 OPC 怎么用它赚钱了。 比如按照剧本做动作,项目直播间里负责讲解和控场;或者做成长期在线的内容入口,卖课、广场星球直播、先知和非洲妹妹这种场面,其实都能让虚拟人去接。 真人直播有状态问题,也有出镜成本。 但虚拟人如果能稳定在线、实时语音、根据脚本做反馈,那它就很适合变成一个低成本的内容入口。 xBubble 这波让我感受比较明显的是,它已经不只是写个网页壳子了。 几天一个 SOP,过几天又一个新玩法,社区也开始从“看客”,慢慢变成真正能自己动手的“极客”。 我甚至开始期待它下一次又会把什么东西做出来了。

Mr.理想三旬(🌸,🍃)(FREE,WON)

12,775 görüntüleme • 2 ay önce