
实践哥 Li
@MinLiBuilds • 20,200 subscribers
AI Builder 超级个体。实践哥Li不做概念党,只聊 AI 实战。分享Claude,Codex,Grok,Gemini, 开源大模型各种一手折腾心得。
Shorts
Videos
0:23
Sensitive content
This media may contain sensitive content.

元宇宙又复活了。 Meta 眼镜 这次把 VR 干到了 100 克。 比 Quest 3 轻差不多 5 倍,$1300,明年春天发货。 刚好我这两天在云栖大会逛了一圈。 一个非常强烈的感觉: 🔥做 AI 视频的公司,已经多到离谱了。 走几步一家。 广告视频、商品视频、数字人、短剧、自动剪辑…… 大家底层接的模型其实也越来越像。 所以我现在看一个 AI 视频产品,已经不太关心: 你又接了几个模型。 能不能让我少操心才关键。 如果乔布斯还在,他会怎么给这副 Meta 眼镜拍一条广告? 🔥我直接 0 帧起手,嘴炮 Pexo。 要求就几个: 100g、轻、未来感、VR 真正变成一副眼镜。 然后让它自己出脚本、拆镜头、做关键帧,再一段段生成。 哪里不对继续聊。 Pexo还能调整细节,直接用 Mark to Fix 圈出来改。 这是 Pexo 跟我在展会上看到一堆视频工具,最大的区别。 现在这个行业太卷了: Veo、Kling、Seedance、万相……模型一大堆。 15 秒、30 秒、不同分辨率、不同价格、不同积分…… 普通用户哪有空天天研究这些破玩意。 一个真正有用的镜头,可能就 3~5 秒。 该用哪个模型,让 Agent 自己选。 该拆成几个镜头,让 Agent 自己想。 Motion、重生成、剪辑、音乐、字幕…… 这些东西最好都别让我看到。 AI 视频公司越多,Pexo 这种产品反而越有意义。 把这一堆 AI 视频工具,全藏到一个 Agent 后面。
实践哥 Li112,602 views • 5 days ago

卧槽,国产开源这次真把实时同传做出来了。😲 看了雨哥这条,我深度评测了网易有道的这两个模型。R2T2实时听写模型,T3PO 实时翻译。 🎉牛逼的是,两个模型一上来就把 Hugging Face 各自的 Trending 分区第一拿了: R2T2:ASR #1 T3PO:Translation #1 🔥更骚的是,这两个都能 Streaming,而且还能直接串起来。 怎么记住这两个模型,一个是R开头,Realtime,一个是T开头,Translation。后面阅读就会顺一些。 对面的话还没说完,中文字幕已经出来了。所以我直接搞了个很抽象的 Demo: 😍如果邻居娶一个乌克兰老婆,用英语连续跟他吵 30 秒。 中间老公回嘴、老婆切俄语、再切乌克兰语,我作为隔壁老王插话。 乌克兰语,它是没训练过的,我来盘盘它 😂 ASR+Translation, 除了视频字幕,以后直接挂在电脑上,挂录音豆里,挂手机上,挂AI眼镜上: 看剧、Zoom、Meet、Teams、Discord、跨国电话…… 对面老外说话,你屏幕下面直接出中文。 出国泡吧搭讪也更方便。 下面视频就是完整实测。 R2T2|实时 ASR T3PO|实时翻译
实践哥 Li68,065 views • 6 days ago

3D 打印任务:Sol 14分钟 VS Step 5 Preview 54分钟。 猜猜哪个差点没打印出来? 这次我参与了 Step 5 Preview 的提前评测。 没有跑传统 Benchmark,我直接拉来 GPT-5.6 Sol,让两个模型用 Computer Use 干一个真的会翻车的任务: 照着参考图,在 Blender 里做一只 8cm 弹簧毛毛虫,最后直接拿去 3D 打印。 两边环境完全一样: pi coding agent + Computer Use + Blender 5.2.1 + 1M Context,Thinking 各自最高档。 要求也很简单: 做出来,而且真的能打印。 🚀结果速度差得非常夸张。 Sol:14分34秒。 Step 5 Preview:54分40秒。 我一开始都以为 Sol 赢麻了。 结果真把 STL 丢进打印机以后,反转了。 Step 5 Preview给毛毛虫做了完整、平整的底面,整个模型贴床很稳,顺利打印完成。 Sol 则主要靠几个小脚接触热床,底部明显拉丝,打印的时候看得我都有点慌,差点翻大车。 🔥更有意思的是 Step 5 Preview整个执行过程。 首发,刚上线涌入太多人了,测起来需要一些时间等待。 它第一轮Thinking 就接近 17 分钟。 后面为了尾巴上的 StepFun,自己用贝塞尔曲线一点一点抠字。 真的非常认真。 当然也有点好笑: 因为模型只有 8cm,最后真打印出来以后…… Logo 太小,其实也没多清楚。😂 🤔以前测 Agent,代码跑通、文件生成,基本就算完成。 可一旦进入物理世界,事情完全不一样。 Blender 里看着没问题,不代表真能打出来。 底面够不够稳、有没有悬挑、哪里会拉丝、模型到底能不能站住…… 很多东西都需要 Agent 自己判断、自己检查。 所以这次 Step 5 Preview虽然花的时间更多, 但它给我的感觉更像是在做一件事: 不是赶紧把任务“做完”,而是尽量把东西“交付出来”。 速度当然重要。 但真的进入物理世界以后, 知道哪里值得多检查一次,可能比早 40 分钟交卷更重要。 我后面又跑了一轮实验。 我把底面、悬挑、可打印性明确写进 Prompt,两边其实都做得挺好。 Sol 那次不是不会,是太自信,14 分钟就急着下班了。 Step 5 Preview这次虽然慢,但也因此多检查了一些真正影响打印的东西。 全过程、最终打印效果,我都放视频里了。
实践哥 Li87,236 views • 9 days ago

突然发现,之前折腾什么 Tailscale + tmux、Claude Remote、Codex 远程,全他妈浪费时间。 这才是终极的手机 AI 远程。 目前体验下来最舒服的产品,手机上看到的 100% 和你电脑上的那个终端一致。 我手机使用的是 Qwen3.8-27B Dense,用 Pi 连模型。 如果你家里跑着 Qwen、GLM、Kimi、MiniMax 这类本地模型,你大概率遇到过一个很蠢的问题: 模型就在家里。 Agent 也在家里跑。 但你一出门,它就跟你失联了。 现在手机上直连 Mac/pc 正在跑的终端 Agent。 不是远程桌面里缩放半天找窗口!! 就是真正的终端。 完整 TUI、会话列表、多 Session、手机输入,断开以后任务继续跑,回来继续handoff。 现在出门,掏出手机就能继续让家里的 Qwen 干活。 这软件本来是远程游戏软件,结果这一轮升级,莫名其妙把自己做成了本地模型的手机端。 玩本地模型的,真可以试试这个。 👀
实践哥 Li221,317 views • 24 days ago

无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:
实践哥 Li91,610 views • 13 days ago

何同学的 iPhone 18 Pro 宣传片夯爆了。 他这个视频到底用了什么模型?传统 CG 艺术家也太强了。 这种以前明显要导演 + 剪辑 + 动效 + CG 才能做的片子,现在普通人能不能拿 AI 搞? 刚好最近我在测一个 AI 视频产品 Pexo。 我直接 0 帧起手,嘴炮 Pexo,跟它边聊边把视频做出来。 🔥 开始我就提要求,我要一支运动鞋广告。镜头钻进鞋子内部,鞋底液态成型、鞋面现场织出来、鞋带自己穿孔。 几十只鞋在流水线上狂奔,最后一只直接“跑”到真人脚上,再收一个干净的产品特写。 先看鞋款设计图和关键帧,确认样子,再看“镜头钻进鞋里”这段转场。方向对了,继续往下做。 当然,镜头出来也不是直接交卷。 比如“鞋跑到脚上”这一段,中间有版鞋飞过去了,脚却没套进去。镜头再炫,鞋没穿上也得重做。 画面里有哪个地方想改,还能用 Mark to Fix,直接圈出来,在右边的批注框里写清楚要求,再提交修改。跟给文档留批注差不多。 最后做出来,是一条 31 秒的完整视频。 🔥以前我做 AI 视频特别喜欢干一件蠢事:上来先选 15 秒、30 秒,选最好最贵的模型。 现在回头看:全他妈浪费钱。😂 一个镜头真正有用的部分可能就 3~5 秒。 比如鞋底成型,4 秒已经结束了。 你偏要生成 15 秒,后面 11 秒模型只能开始自己发挥: 鞋开始变形、镜头开始乱飘。 最后你花了 15 秒的钱,真正剪进成片的可能只有 4 秒。 包括不同的生成镜头,也不是一个模型全部包圆。 Seedance、Kling、Hailuo 本来就各有所长。 Pexo爽点在,终于不用为了做一条视频,先把各家模型研究一遍了。 剩下的模型选择、镜头拆分、生成、Motion、剪辑、音乐、字幕…… 让 Pexo 自己折腾。 这次我就是一张运动鞋都没有给。 最后硬是嘴炮出了一支广告。😂 我的制作过程全部开源了。 免费粉丝福利,100视频积分获取👇
实践哥 Li31,233 views • 5 days ago

国外 AI 又杀疯了。 Fable 5.1、GPT-6 Astra、Image 2.5,几天之内一个接一个,一个比一个猛。 模型更聪明了,Coding、Agent、Computer Use、3D、图像能力全面升级。 普通人最后只关心一件事: 老板发来的 PPT,它到底能不能帮我改。 而真到了 PPT、Excel、Word 这些场景,国内可能真的有主场优势。 国内办公 Agent,我直接押豆包工作。 OpenAI、Anthropic 再牛逼,到了办公这块,也得找 Agent 接文件、接 Office、接电脑、接协作。 🔥 但是,豆包后面直接站着飞书。这就有点不讲武德了。 而且最近豆包工作还在疯狂补能力。 我这次真正爽到的,第一个就是 PPT。 我直接跟它说: “豆包豆包,把今天小米发布会的车,做成一个雷军风格的 PPT。” 然后我一看: 我操,真 PPT。 不是网页,不是截图。直接 是.pptx,真PPT,文字、图片、元素随便改。 1/n
实践哥 Li86,431 views • 20 days ago

两个 session 通信的方法: 1. /rename,给每个 session 命名,例如 jack,tom 2. 对其中一个 jack 说,告诉 tom,xxxx
实践哥 Li189,745 views • 1 month ago

第一次有种感觉:昨天花时间教 AI,没白教。 最近玩 Today AI,让我最爽到的就是这个。 我让它参考苹果官网,给 Microduck 机器人做产品页。 🔥第一轮翻车:大标题、留白都有,产品图没了,卡片错位。苹果的骨架,灰色的占位块。 🔥修复版补齐主视觉、参数区和四张商品卡,排版也保住了 🔥隔天我换了个题:“同样的风格,做个 卖SpaceX 的网站。” 没重贴参考,深色主视觉、参数布局、大标题的节奏接上了,Today 一次成稿。 终于有种“昨天没白教”的感觉。 更有意思的是后面。 第二天我还没开始输新 Prompt,它在说早安时主动提出: “Microduck 页面还有一个待确认项:移动端卡片布局。如果今天继续测试,建议先确认这个。” 这一下感觉就不一样了。 它甚至已经知道,接下来该干什么。 🚀 我们纠正 AI 的经验,到底怎么留下来? 给 Agent 写 CLAUDE.md、配 Skills,就是把背景、规则、流程放在模型外面,需要时读进上下文。这类“外脑”,很多时候还得我们自己整理、维护。 Today 会把人物、项目、偏好、约定整理成结构化记忆,跨会话、跨设备保留,供后续任务检索使用。 我期待的就是这种“做梦”体验:白天一起干活,把踩过的坑、确认过的要求留下来,第二天配合得更顺。 🔥写内容,能不能沿用我确认过的口吻? 跟项目,能不能少让我重讲一遍背景? 这些比一次做出漂亮网页,更有价值。 甚至在我没开口时,它能预判到我的预判,直接推进下一步。
实践哥 Li58,955 views • 22 days ago

卧槽,可以去开 token 无限量供应咖啡店了,你买咖啡,我提供 Opus4.6 级别的 token。 可以支持十几个人共同使用。 Qwen3.8-27B 这个 Dense 模型,我刚跑完一轮。 跑的完全体,非量化版本,显存占用 84G 左右。 配置是4090 48G*2 : 单流稳定在 31~32 tok/s, 1024 token 输入,TTFT 只有 562 ms。 并发情况让我吃惊: 并发 1:31.4 tok/s 并发 2:58.4 tok/s 并发 4:108.5 tok/s 并发 6:144.5 tok/s 并发 8:185.6 tok/s 从 1 并发到 8 并发,聚合吞吐直接涨了 5.9 倍。 而且到并发 8 还在继续涨,还没看到吞吐拐点。 还有一个很重要的点: random token 是 31.39 tok/s, 真实 Prompt 是 32.0 tok/s。 几乎没区别。 这个 32 tok/s 能反馈真实速度。
实践哥 Li116,199 views • 1 month ago

99% of iPhone users don’t know this: Their phone already has a free music production powerhouse hidden inside. It’s one of the treasures left behind from the Steve Jobs era. Millions of people own an iPhone, iPad, or MacBook — but have never truly opened it. I asked an AI Agent to create a completely new piece of music from scratch. The result surprised me. It wasn’t just generating audio. It could be edited. Sounds, channels, tracks — everything was adjustable. But I didn’t ask AI to generate an MP3. Instead, I asked it to create a: structured, editable, and extendable music project. The model had to understand: 🎹 Main melody 🎻 Harmony relationships 🥁 Rhythm design 🎸 Instrument arrangement 🎼 Multi-track structure The final output was MIDI, which was imported directly into GarageBand. And this reveals a key difference: Traditional AI music tools like SUNO often generate the final audio directly. You get an MP3. It sounds good, but it’s difficult to modify. MIDI is like the Python of the music world. And this is exactly where Ling-3.0-flash Ant Ling shines. It works like a high-speed execution engine in an AI workflow: ⚡ Low latency 💰 Cost-efficient 🔧 Stable tool calling It can transform complex plans into real outputs quickly. In this music creation workflow, it can independently handle: •Which instruments should play •Which notes should be combined •How rhythms should evolve •How different tracks should interact After importing into GarageBand, you can: ✅ Edit the melody ✅ Replace instruments ✅ Adjust tempo ✅ Re-arrange the composition ✅ Add your own creativity I was genuinely impressed by the result. Try it.
实践哥 Li140,444 views • 2 months ago

如果 giffgaff 不封号,我们压根儿不会打开它的网站。 你有没有发现,视频里这个正在说话的人也有点不对劲? 很多重要账户,只要不出问题,就会像不存在一样。 我的股票和数字货币就分散在七八个券商、交易所里,经常错过大涨大跌。 要打开一堆 App,找密码、截图、记录、对比,再拿计算器做加法,甚至还得用纸记下来,非常狼狈。 步骤一多,结果通常只有一个: 懒得看。 可能隔了半年,等某个资产突然大涨大跌,才想起来检查自己的持仓。 所以我换了一种方式: 把不同券商和数字货币交易所的持仓截图,全部发到 iMessage(爆火中,如果号码不行就去官方找最新号码): +1 (650) 248-0054 再通过 Airtap 设置一个定时任务。 它能帮你盯盘,第一次盯盘就帮我赚了 400 刀。 它可以读取截图里的持仓,也可以登录券商和交易所 App,自动获取最新持仓。 每天固定时间,它会整理资产日报,并搜索市场异动背后的原因,告诉我: 💰 每天的资产总额和持仓明细 📈 哪些资产变化最大 ⚠️ 哪些仓位出现异常 📰 有没有对应的新闻 🔍 波动可能由什么引起 每天收到一份清爽的资产日报 只需两个免费iMessage完成设置👇 #justtextit #textyourapps #airtap
实践哥 Li119,622 views • 1 month ago

Giffgaff论坛已沦陷,全是骂的,不是说充一次用30年么? 关于退款,如急走邮件,不急等处理。 这里必须挺一下苹果,二十年前的软件还这么好用,终生免费
实践哥 Li123,852 views • 2 months ago

Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。
实践哥 Li66,035 views • 1 month ago

突然发现之前折腾什么Tailscale+tmux,claude remotion,codex远程全他妈浪费时间。 这才是终极的手机AI远程,目前体验下来最舒服的产品。100%跟你本地电脑一致。
实践哥 Li222,856 views • 4 months ago

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。 我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。 接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。 🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。 「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。 Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。 🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。 两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿 Qwen3-4B 当初始化权重,连同音频编码器一起全参数微调。 我把它的解码器和原版 Qwen3-4B 逐层比对过,每一层都有变化。所以不是白嫖 Qwen 的语言知识,避免了从零预训练语言能力。这条路叫 Encoder-Adapter-LLM。 最后还有一个牛逼的点: Open ASR Leaderboard全球第 7,开源多语言 ASR 第 1。 五语种平均 WER 3.54%,而且权重开放、评测公开、结果可复现。 现已支持四川话、广东话小语种。 Apache 2.0 开源。
实践哥 Li47,158 views • 26 days ago