Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

以后机器人产品的官网就照着这个思路做,否则我不看~ Microduck 被解剖了,源码在 Hugging Face 上,并持续更新中~该网站吧 Microduck 的舵机、摄像头、ToF LiDAR、计算模块、电池、骨架全部拆开给你看,还能旋转、走路,甚至直接拖它的腿和脑袋。 本来以为只是一个做得比较炫的 3D 网页,翻了一下项目代码,发现里面塞的是真东西~ ① 官方 3D 模型直接塞进去了 项目使用了 Microduck 的 GLB 3D 模型,来源指向 Pollen Robotics 的 microduck_rl。 所以你看到的并不是作者照着机器鸭外形重新画了一个动画,而是把机器人的 3D 模型直接搬进浏览器,通过 Three.js 实时渲染。 ② 连真实步态数据也塞进去了 更有意思的是走路。 源码里直接放了一组 MICRODUCK_WALK_FRAMES,记录 Microduck 行走过程中各个关节的角度。 程序读取这些数据,再经过插值处理,实时控制 3D 模型对应关节旋转。 也就是,真实机器人步态数据 → 关节角度 → Three.js → 网页里的 Microduck...

12,186 Aufrufe • vor 22 Tagen •via X (Twitter)

7 Kommentare

Profilbild von 风雪漫千山
风雪漫千山vor 22 Tagen

那个可旋转的骨架,拿来当官网很耐看

Profilbild von 玉米_AlphaNotes
玉米_AlphaNotesvor 22 Tagen

这个交互是参考官方参数的,可用性很强

Profilbild von 风雪漫千山
风雪漫千山vor 22 Tagen

难怪,按官方参数来就不只是好看了

Profilbild von 玉米_AlphaNotes
玉米_AlphaNotesvor 22 Tagen

3D Microduck 的演示地址:

Profilbild von Saquib Mehmood
Saquib Mehmoodvor 22 Tagen

OK. This is truly awesome.

Profilbild von Crio Songo
Crio Songovor 21 Tagen

这种展示方式确实比堆参数放硬广直观多了,我去看了下,每个部件都能交互拆解,这个思路确实值得很多机器人产品抄作业。

Profilbild von Xsoraanti
Xsoraantivor 22 Tagen

那你还不赶紧做?你只光说不练?

Ähnliche Videos

Microduck 本身只开源了microduck 和 microduck_rl,它在电脑上无法操控,不方便~ 于是乎,我耗费了一周的使用额度,做了个 microduck-studio 并开源了,希望以后玩 Microduck 的人,能少踩一点我踩过的坑。 开发机器人的时候,真正折磨人的很多时候不是代码,而是环境、端口、进程、socket、仿真和运行时散落在各处。服务明明都启动了,机器人就是不动,然后开始一个终端一个终端排查,这些坑我已经踩过一遍了,就没必要让后来的人再踩一遍,所以我做了三件事: ① 把开发环境串起来 Docker、robotd --sim、MuJoCo Viewer、Web 服务统一到一条可重复的一键启动链路里。 不用再开一堆终端,手动拼端口、socket 和进程。 ② 把状态直接摆出来 robotd、MuJoCo、策略、仓库状态都可以直接查看,也可以执行移动、停止和技能指令。 哪里出了问题,不用再靠猜。 ③ 把“启动成功”变成“真的能用” 服务启动后会继续做联通测试,真正发送控制指令,确认仿真机器人能够移动。 不是网页能打开就算成功,而是整条控制链路真的跑通。 microduck-studio 不替代 microduck,也不替代 microduck_rl。 它只是把原本零散的开发流程,整理成一个更容易使用、更容易排错的“本地控制室”。 如果它能让后来开发 Microduck 的人少踩几个坑、少开几个终端、少浪费几个小时排查问题,那这个项目就已经有价值了。 自己踩过的坑,顺手填上。 自己走通的路,给后来的人留个路标。 项目地址放评论区了 🔽

玉米_AlphaNotes

21,902 Aufrufe • vor 19 Tagen

机器人最近太火了吧!人形机器人百米 8.86 秒直接破了记录! 最有意思的是看到最后,这个机器人跑到终点后直接撞墙,太抽象了~ 我好奇自己能不能做一个类似的游戏,于是我顺手用 Gear Gear Zero 做了一个《机器人赛跑》的游戏。 最初我只有一个核心操作设计,就是分别用 Z 和 X 键控制机器人的左右腿,必须交替按键才能往前跑,按得越快,机器人冲得越快。 但除了这个核心操作之外,机器人应该怎么跑、画面怎么表现、速度怎么计算、冲刺动作怎么做,这些我都没做设计, 剩下占工作量大头的部分全交给 Gear 开始补。 它把一个简单的按键想法继续拆成完整的竞速玩法,再去处理画面、动作、物理效果和成长系统,最后自己规划、写代码、构建,直接给出一个能玩的版本。 做到后面还想起现实里机器人冲线刹不住的画面,于是又临时加了一条。 比赛赢了别庆祝,继续往前冲,最后一个接一个撞墙。 它也直接做进去了。 这其实是 Gear Zero 比较吸引我的地方。 做游戏最难的往往不是冒出一个点子,而是这个点子后面还有大量没想过的细节。 现在可以先把最核心的想法给 Gear,剩下的边做边补,第一版出来以后再继续玩、继续改。 不用碰游戏引擎,也不用自己写代码,最后直接在浏览器里就能玩。 AI 现在验证一个想法已经快到这种程度了。 有灵感的时候,先让AI做出来,好不好玩直接运行起来就知道了。 体验地址:

木马人

14,079 Aufrufe • vor 27 Tagen

🔥AI搬回本地! $NVDA 黃仁勋剛剛宣布重大突破, 个人电脑迎来全新时代! ———————————— 过去四十年,一直是你在伺候电脑。 这一次,它要反过来。 我们这代人,是被机器训练大的。记快捷键,清后台,等进度条,文件存在哪个文件夹自己得记牢,我们学会的全是“迁就它”,把自己一点点训练得像台机器,它才肯好好干活。 所以黄仁勋这次最重要的东西,很多人看漏了。不是又一个开源模型,也不是新芯片的跑分。是 AI 要从云端“搬回家”,住进你这台本机里。 这两年我们用的 AI,说穿了都是“租来的大脑”。你得先把家底打包上传:合同、工资条、还没写完的东西、和家人的聊天记录。它在别人的机房里跑,按别人的价收钱,入口攥在别人手里。聪明是真聪明,可它始终不是你的,你只是个访客。 而“本地 Agent”这四个字的意思是:这些东西,终于可以留在你自己屋里了。不用上传,不用排队,不用看网速的脸色。它能看你的文件、懂你开着的软件、替你把那些零碎活儿干完。第一次,电脑不再是你点一下它动一下的工具,而是一个会自己动手的人。 为了这件事,老黄把数据中心级的算力,上百 GB 的统一内存、接近一个 petaflop 的性能,硬塞进了一台摆得上书桌的小机器。不是为了让你在本地跑个玩具模型,是为了让你桌上这台电脑,真有本事自己干活。 往大了说,棋局其实很清楚:云端那颗大脑,继续在数据中心里想最难的事;你桌上这台,负责手脚,管你每天的柴米油盐。而老黄想要的,是大脑和手脚,两头都攥在自己手里。 但我更想讲的,是那种很具体的感觉。PC 是上一代互联网的入口,手机是移动时代的入口。下一个入口不在某个网站里,就在你书桌上那台开机的电脑里。谁先住进去,谁拿下下一个十年。 所以他这次真正想说的,从来不是“我们出了块更强的芯片”。 而是过去四十年,你把自己训练得越来越像一台电脑。 从今往后,是电脑,开始学着像你请来的那个人。

老白

14,544 Aufrufe • vor 3 Monaten

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

35,737 Aufrufe • vor 9 Tagen

我去!这姐真的是脑洞大开,一个人用 GPT-6 Astra,把一整套专业人体解剖数据库做成了能搜索、能拆解、能实时旋转的 3D 网站: 包括2,234 个独立网格、15 个解剖系统、3,432 个命名概念:骨骼、肌肉、动脉、神经、器官都能单独显示或隐藏。 搜一下 Heart,系统直接选中 83 个部件,还能隔离心脏、拉成 100% 爆炸视图看内部结构。 已开源(MIT): 我看了下,这是实时操作的 Web 3D 应用。技术栈 React + TypeScript + Vite + Three.js + shadcn/ui,部署在 Vercel。为了同时拆开几千个结构还能保持流畅,几何模型合并成批次,显示/位移/选中全靠 GPU 纹理控制,爆炸视图只算可见部件。 解剖数据来自 BodyParts3D 4.0(CC BY 4.0),是一套成年男性参考解剖: 它还提供可选的 WebMCP 工具:兼容的浏览器 AI 能调用 find_anatomy、inspect_anatomical_structure,直接搜索并选中人体部位。所以未来你可以直接问 AI「这块肌肉在哪、属于哪个系统」,3D 模型现场演示。 真正有价值的地方:数据清洗、3D 前端、交互设计、性能优化、功能验证过去要数据工程师+3D+前端一起干的活,这姐一个人靠+AI 就跑通了原型。 其实可以拓展的方向还有: 1. 解剖教学、健身课程和患者科普 2. 运动姿态分析与康复进度展示 3. 医疗器械、机械设备和汽车零部件的 3D 爆炸图 4. 博物馆藏品、建筑和工业设备的互动讲解 5. 给 3D 模型接入 AI 问答,让用户直接询问某个部件 6. 中期可以加入可穿戴设备、动作捕捉和摄像头数据,让系统比较不同时间的运动变化,辅助理疗师和教练查看训练效果。 更远的方向是个人数字人体。把 MRI、CT、体扫描和可穿戴数据组合起来,生成与个人身体对应的模型,用于术前沟通、康复管理和远程医疗。虽然还有很长一段距离,但是已经看到了可能性。

森叔

16,778 Aufrufe • vor 15 Tagen