实践哥 Li's banner
实践哥 Li's profile picture

实践哥 Li

@MinLiBuilds • 20,200 subscribers

AI Builder 超级个体。实践哥Li不做概念党,只聊 AI 实战。分享Claude,Codex,Grok,Gemini, 开源大模型各种一手折腾心得。

Shorts

英伟达和 Palantir,都开始限制 Claude 了。 Reuters 报道,英伟达已经把 Anthropic 模型限制在低敏感度任务。 Palantir 更直接:要求 Anthropic 提供不可撤销的 Zero Data Retention 保证,否则不愿意把模型开放给客户。 原因很简单: 自己的核心数据,不能随便被Anthropic查看。 巧的是,Anthropic 前几天刚发布 AI 安全报告,提到黑客、监控、诈骗,以及敏感数据流转等风险。把细节全公布了。 本来是想证明自己多重视安全,结果大公司可能只想到一句: 那我的数据是不是已经被看过了?🚀

英伟达和 Palantir,都开始限制 Claude 了。 Reuters 报道,英伟达已经把 Anthropic 模型限制在低敏感度任务。 Palantir 更直接:要求 Anthropic 提供不可撤销的 Zero Data Retention 保证,否则不愿意把模型开放给客户。 原因很简单: 自己的核心数据,不能随便被Anthropic查看。 巧的是,Anthropic 前几天刚发布 AI 安全报告,提到黑客、监控、诈骗,以及敏感数据流转等风险。把细节全公布了。 本来是想证明自己多重视安全,结果大公司可能只想到一句: 那我的数据是不是已经被看过了?🚀

319,612 Aufrufe

告诉大家无限用 Astra 6.0 的方法。 打开 ChatGPT,或者在移动端切到 Chat 模式,就能一直聊。 额度独立,不影响你 codex 里的额度。 聊技术、拆问题、捋思路、改文案,能干的事非常多。 很多事情,聊明白就解决了。

告诉大家无限用 Astra 6.0 的方法。 打开 ChatGPT,或者在移动端切到 Chat 模式,就能一直聊。 额度独立,不影响你 codex 里的额度。 聊技术、拆问题、捋思路、改文案,能干的事非常多。 很多事情,聊明白就解决了。

323,119 Aufrufe

雷总今晚是真的有点飘了 😂 出来亲自讲小米澎程,讲到智驾的时候,直接拿友商开涮: 全系标配,买车就能用。 有的友商,高阶智驾每个月还要交近 500 块。 没点名。 但华为乾崑 ADS Max 连续包月,刚好 499 元/月。 以前雷军发布会: “友商也非常优秀。” 🔥看来真的股价焦虑了。 至于价格,网友说9.9包邮,有视频为证

雷总今晚是真的有点飘了 😂 出来亲自讲小米澎程,讲到智驾的时候,直接拿友商开涮: 全系标配,买车就能用。 有的友商,高阶智驾每个月还要交近 500 块。 没点名。 但华为乾崑 ADS Max 连续包月,刚好 499 元/月。 以前雷军发布会: “友商也非常优秀。” 🔥看来真的股价焦虑了。 至于价格,网友说9.9包邮,有视频为证

273,156 Aufrufe

😲 柯洁来小红书教围棋了。 金发、深 V 黑西装、白色阔腿裤,开口还喊“宝宝们好”。 我第一眼甚至没认出来这是柯洁。 但仔细想想,人家已经是八冠王了,赚的钱也不少,根本没必要跑到小红书上收割韭菜。🤔

😲 柯洁来小红书教围棋了。 金发、深 V 黑西装、白色阔腿裤,开口还喊“宝宝们好”。 我第一眼甚至没认出来这是柯洁。 但仔细想想,人家已经是八冠王了,赚的钱也不少,根本没必要跑到小红书上收割韭菜。🤔

44,649 Aufrufe

太魔幻了,Astra 还在让大家惊叹:AI 终于会用 Blender 了。 结果Nex-AGI 已经直接出现在现实世界里了。 我只给了一个 Prompt: 做一根 6cm 的粉色活动香蕉,省点料。 然后我基本没碰 Blender。 它自己用 MCP 建模,Computer Use 看结果、自己修,最后直接吐给我一个 STL。 我顺手扔进拓竹。 👇 视频里正在一层一层长出来的,就是它自己设计的香蕉。 这一刻我是真有点惊到了。 Nex-AGI + Computer Use,能力完全超出我预期。 一句话 → Blender → STL → 3D 打印 → 实物。 🔥 这真的有点科幻了。 直接免费体验nex-agi :

太魔幻了,Astra 还在让大家惊叹:AI 终于会用 Blender 了。 结果Nex-AGI 已经直接出现在现实世界里了。 我只给了一个 Prompt: 做一根 6cm 的粉色活动香蕉,省点料。 然后我基本没碰 Blender。 它自己用 MCP 建模,Computer Use 看结果、自己修,最后直接吐给我一个 STL。 我顺手扔进拓竹。 👇 视频里正在一层一层长出来的,就是它自己设计的香蕉。 这一刻我是真有点惊到了。 Nex-AGI + Computer Use,能力完全超出我预期。 一句话 → Blender → STL → 3D 打印 → 实物。 🔥 这真的有点科幻了。 直接免费体验nex-agi :

158,037 Aufrufe

1 一个人走进 AI 生成的巷子,说了句召唤——天上真飞下来一只鹰。🦅 这不就是《盗梦空间》么? Alaya World 干的就是这种事:一句话、一张图丢进去,实时长出一个能逛的世界。你挪视角,街巷往前展开;走到一半打一句提示词,里面真会跟着变。不是后期特效,是当场生成的。 说个暴论:未来游戏开发可能要变天了——先生成一个可玩的 demo,然后就直接上线了。🎮 我们现在用的 AI,多半还是打字进、文字出,最多再给你一张图、一段视频。看完就结束,你始终站在屏幕外面。 可以这么理解: • 💬 聊天模型陪你说话 • 🎬 视频模型给你放片 • 🌍 世界模型开始给你一个能走进去晃两下的地方 它还不完美,偏研究向,家用电脑也跑不动——别当成明天就能下载开玩的游戏。但代码开源了,主页上 Demo 很多,光看就能明白:AI 下一步可能不只是更会聊天,而是开始撑起一个空间。 想直观感受,直接刷 Alaya Lab 的 Demo,比看任何介绍都快。 1.🐦‍ 召唤火鸟 冷却好了,点火鸟技能。烟尘里冲出一只燃烧的凤凰,双翼一展,脚下黑烟烈焰

1 一个人走进 AI 生成的巷子,说了句召唤——天上真飞下来一只鹰。🦅 这不就是《盗梦空间》么? Alaya World 干的就是这种事:一句话、一张图丢进去,实时长出一个能逛的世界。你挪视角,街巷往前展开;走到一半打一句提示词,里面真会跟着变。不是后期特效,是当场生成的。 说个暴论:未来游戏开发可能要变天了——先生成一个可玩的 demo,然后就直接上线了。🎮 我们现在用的 AI,多半还是打字进、文字出,最多再给你一张图、一段视频。看完就结束,你始终站在屏幕外面。 可以这么理解: • 💬 聊天模型陪你说话 • 🎬 视频模型给你放片 • 🌍 世界模型开始给你一个能走进去晃两下的地方 它还不完美,偏研究向,家用电脑也跑不动——别当成明天就能下载开玩的游戏。但代码开源了,主页上 Demo 很多,光看就能明白:AI 下一步可能不只是更会聊天,而是开始撑起一个空间。 想直观感受,直接刷 Alaya Lab 的 Demo,比看任何介绍都快。 1.🐦‍ 召唤火鸟 冷却好了,点火鸟技能。烟尘里冲出一只燃烧的凤凰,双翼一展,脚下黑烟烈焰

928,395 Aufrufe

这个新闻越看越觉得牛逼。 张一鸣张首富要带大家永生了。 🔥 部署 1 万个实验台自动做实验消灭癌细胞,看到这个想象力了 字节拆出来的 Anew Labs,昨天刚融了 2.9 亿美元,估值 15 亿美元,字节融资后还持股 56%。 然后今天直接发布 AnewDDE: 结构预测 → 分子设计 → 亲和力计算 → AI 科学推理 → 实验反馈 → 再设计下一轮。 这里最牛逼的是:湿实验也开始进 loop 了。 湿实验是什么? 就是 AI 不是在电脑里算完就结束,而是真的去实验室合成分子、测蛋白、测结合效果,用现实世界的结果验证。 以前这一步必须大量靠人。 🔥进一步的,我想到一个恐怖的点。 如果一个湿实验可以被机器人自动化,那它就可以复制。 不是一个实验慢慢做。 而是: 100 个、1000 个、10000 个实验,同时跑。 这么想下去就有点科幻了。 难道人类真要靠 AI 把癌症一个个干掉🫡

这个新闻越看越觉得牛逼。 张一鸣张首富要带大家永生了。 🔥 部署 1 万个实验台自动做实验消灭癌细胞,看到这个想象力了 字节拆出来的 Anew Labs,昨天刚融了 2.9 亿美元,估值 15 亿美元,字节融资后还持股 56%。 然后今天直接发布 AnewDDE: 结构预测 → 分子设计 → 亲和力计算 → AI 科学推理 → 实验反馈 → 再设计下一轮。 这里最牛逼的是:湿实验也开始进 loop 了。 湿实验是什么? 就是 AI 不是在电脑里算完就结束,而是真的去实验室合成分子、测蛋白、测结合效果,用现实世界的结果验证。 以前这一步必须大量靠人。 🔥进一步的,我想到一个恐怖的点。 如果一个湿实验可以被机器人自动化,那它就可以复制。 不是一个实验慢慢做。 而是: 100 个、1000 个、10000 个实验,同时跑。 这么想下去就有点科幻了。 难道人类真要靠 AI 把癌症一个个干掉🫡

114,712 Aufrufe

牛了。原来做一个 App,真的这么简单? 今天三年级女儿在 iPad 上玩围棋,我看广告太多,就说: 要不你自己做一个? 刚好我手上有个 Muse 邀请码,直接开干。 她没开发过 App,我也没搞过。 原来开发 APP 给自己用并不需要注册 Apple Developer,只要一根充电线就可以了。 她说先做国际象棋。 🔥10 分钟后,已经装到 iPad 上能玩了。 然后她又说: “我还想要国际跳棋。” 加,马上又好了。 全程我帮他选了一个音乐。 她最后的感言是: 🔥 “开发游戏还是有点久,我都能跟奶奶刷两个短视频了。” 我听完笑死。 以前你爹开发这样的游戏要半年呢。 她这一代可能会觉得: App,就是想要什么就加什么。 如果你有 MUSE 邀请码可以丢到评论区。

牛了。原来做一个 App,真的这么简单? 今天三年级女儿在 iPad 上玩围棋,我看广告太多,就说: 要不你自己做一个? 刚好我手上有个 Muse 邀请码,直接开干。 她没开发过 App,我也没搞过。 原来开发 APP 给自己用并不需要注册 Apple Developer,只要一根充电线就可以了。 她说先做国际象棋。 🔥10 分钟后,已经装到 iPad 上能玩了。 然后她又说: “我还想要国际跳棋。” 加,马上又好了。 全程我帮他选了一个音乐。 她最后的感言是: 🔥 “开发游戏还是有点久,我都能跟奶奶刷两个短视频了。” 我听完笑死。 以前你爹开发这样的游戏要半年呢。 她这一代可能会觉得: App,就是想要什么就加什么。 如果你有 MUSE 邀请码可以丢到评论区。

27,809 Aufrufe

🤔都 TM七八年过去了,机器人还在叠衣服。 今天在云栖大会,我又看到机械臂叠衣服。 拿杯子、抓香蕉、叠衣服,这类 Demo 看了太多年。 具身智能模型泛化很难。换件衣服,换张桌子,摄像头挪一下,换个房间,甚至换台机器人,可能就崩了。 🔥今天凌晨的FLUX 3 Action,牛逼了。 一家原本做图、做视频的公司,突然把 FLUX 变成了机器人的“大脑”。 7B。 不仅能控机械臂,还能打 FPS、开赛车、飞无人机。 RoboLab-120 上成功率 42.92%,目前排第一。 🔥原理太有意思了 传统 VLA 更像:看见现在 → 预测下一步动作。 FLUX 3 Action 多了一层:看见现在 → 想象未来 → 同时预测 Action 视频模型为了生成下一帧,本来就在被迫学习:物体怎么运动,遮挡怎么发生,视角怎么变化,一个动作发生以后,世界会变成什么样。 🔥李飞飞好不容易分好类的世界模型,渲染、仿真、规划,又被打乱了 未来最强的具身模型,可能直接从视频模型长出来的。 下面引用的前端哥用的边聊边生成的。视频生成模型,我现在也不太想只把它当视频模型看了。我准备也盘盘它,叫 pexo 是吧。 ✈️视频模型是根据图片猜后帧,那直接输入现实世界的连续序列...🤔

🤔都 TM七八年过去了,机器人还在叠衣服。 今天在云栖大会,我又看到机械臂叠衣服。 拿杯子、抓香蕉、叠衣服,这类 Demo 看了太多年。 具身智能模型泛化很难。换件衣服,换张桌子,摄像头挪一下,换个房间,甚至换台机器人,可能就崩了。 🔥今天凌晨的FLUX 3 Action,牛逼了。 一家原本做图、做视频的公司,突然把 FLUX 变成了机器人的“大脑”。 7B。 不仅能控机械臂,还能打 FPS、开赛车、飞无人机。 RoboLab-120 上成功率 42.92%,目前排第一。 🔥原理太有意思了 传统 VLA 更像:看见现在 → 预测下一步动作。 FLUX 3 Action 多了一层:看见现在 → 想象未来 → 同时预测 Action 视频模型为了生成下一帧,本来就在被迫学习:物体怎么运动,遮挡怎么发生,视角怎么变化,一个动作发生以后,世界会变成什么样。 🔥李飞飞好不容易分好类的世界模型,渲染、仿真、规划,又被打乱了 未来最强的具身模型,可能直接从视频模型长出来的。 下面引用的前端哥用的边聊边生成的。视频生成模型,我现在也不太想只把它当视频模型看了。我准备也盘盘它,叫 pexo 是吧。 ✈️视频模型是根据图片猜后帧,那直接输入现实世界的连续序列...🤔

25,104 Aufrufe

这五年电脑硬件的走势有点魔幻。😲 同款CPU:10000 → 33 元。 同款GPU:10000 → 40000 元。 Xeon 6138,20 核 40 线程。 当年正儿八经的服务器 CPU, 33 块包邮。 老黄和奥特曼全责

这五年电脑硬件的走势有点魔幻。😲 同款CPU:10000 → 33 元。 同款GPU:10000 → 40000 元。 Xeon 6138,20 核 40 线程。 当年正儿八经的服务器 CPU, 33 块包邮。 老黄和奥特曼全责

49,439 Aufrufe

听说短剧公司都在搞Minimax H3 本地版 这是视频生成的 Deepseek 时刻 音视频同出,中国的蒜真的不一样 这蒜力,拿来做口播,要起飞 口播的几个流派: 1. 不露脸 2. 嘴唇模型,分本地和线上 3. 专属数字人模型 4. 视频生成模型 接下来我口播的一个最后的版图,就是使用音视频同出的模型去做数字人,看看接下来能不能保持人物的一致性,应该问题不大。

听说短剧公司都在搞Minimax H3 本地版 这是视频生成的 Deepseek 时刻 音视频同出,中国的蒜真的不一样 这蒜力,拿来做口播,要起飞 口播的几个流派: 1. 不露脸 2. 嘴唇模型,分本地和线上 3. 专属数字人模型 4. 视频生成模型 接下来我口播的一个最后的版图,就是使用音视频同出的模型去做数字人,看看接下来能不能保持人物的一致性,应该问题不大。

39,108 Aufrufe

突然发现,之前免费用户为了做点 deep research 各种瞎凑合Gemini、 GPT,问几句就被限速,全浪费时间。 这才是终极的Deep Research工具,登录就能用,旗舰模型,sota,免费。目前体验下来最舒服的产品,一次开出三十几个Agent,又深、又快、又准。 下文我会分享几个常用做 deep research 的场景。 这次我用它来调研十几个港股的打新策略,报告附在后面 👇

突然发现,之前免费用户为了做点 deep research 各种瞎凑合Gemini、 GPT,问几句就被限速,全浪费时间。 这才是终极的Deep Research工具,登录就能用,旗舰模型,sota,免费。目前体验下来最舒服的产品,一次开出三十几个Agent,又深、又快、又准。 下文我会分享几个常用做 deep research 的场景。 这次我用它来调研十几个港股的打新策略,报告附在后面 👇

39,741 Aufrufe

Qwen 又把我燃起来了。🔥 176B 级别的东西,居然不是只能拿机房卡看。 还好梁子上周给 DeepSeek 把眼睛装上了。 不然 Qwen 这波一出来,今天场面多少有点难堪。😂 DGX Spark 能跑。 双 4090 96G 也能跑。 51B 的 N-gram Embedding 往 CPU 内存一扔,剩下的狠狠干进显存。 而且这还不是纯文本模型。 原生多模态,视觉也带。 125B 主模型 + 51B N-gram Embedding,单 Token 实际激活大约 6B。 家里的卡还能不能再榨一下。 消费级卡、DGX Spark、双 4090。 本地推理,YYDS 🫡 这只醍醐是昨天夜里用手机下命令一气呵成的。 只花了 127 秒! 把我震惊了,一次没改,一次成功。 真实长输出测试54.62tok/s,产出16549 字符 / 440 行 HTML。 以下是 prompt👇

Qwen 又把我燃起来了。🔥 176B 级别的东西,居然不是只能拿机房卡看。 还好梁子上周给 DeepSeek 把眼睛装上了。 不然 Qwen 这波一出来,今天场面多少有点难堪。😂 DGX Spark 能跑。 双 4090 96G 也能跑。 51B 的 N-gram Embedding 往 CPU 内存一扔,剩下的狠狠干进显存。 而且这还不是纯文本模型。 原生多模态,视觉也带。 125B 主模型 + 51B N-gram Embedding,单 Token 实际激活大约 6B。 家里的卡还能不能再榨一下。 消费级卡、DGX Spark、双 4090。 本地推理,YYDS 🫡 这只醍醐是昨天夜里用手机下命令一气呵成的。 只花了 127 秒! 把我震惊了,一次没改,一次成功。 真实长输出测试54.62tok/s,产出16549 字符 / 440 行 HTML。 以下是 prompt👇

13,160 Aufrufe

我来试试蒜,这是外国的蒜。 使用 grok 生成,辛辣,比以前的蒜都要辣 20%。 晚点再试试中国本地的蒜。 现在随便来个视频模型,都吊打 sora,不知道奥特曼咋想

我来试试蒜,这是外国的蒜。 使用 grok 生成,辛辣,比以前的蒜都要辣 20%。 晚点再试试中国本地的蒜。 现在随便来个视频模型,都吊打 sora,不知道奥特曼咋想

17,598 Aufrufe

Videos

你们嘴巴真严啊 Muse写小黄文,一级棒啊 还可以跟她聊骚,卧槽
0:23

Sensitive content

This media may contain sensitive content.

MinLiBuilds's profile picture

元宇宙又复活了。 Meta 眼镜 这次把 VR 干到了 100 克。 比 Quest 3 轻差不多 5 倍,$1300,明年春天发货。 刚好我这两天在云栖大会逛了一圈。 一个非常强烈的感觉: 🔥做 AI 视频的公司,已经多到离谱了。 走几步一家。 广告视频、商品视频、数字人、短剧、自动剪辑…… 大家底层接的模型其实也越来越像。 所以我现在看一个 AI 视频产品,已经不太关心: 你又接了几个模型。 能不能让我少操心才关键。 如果乔布斯还在,他会怎么给这副 Meta 眼镜拍一条广告? 🔥我直接 0 帧起手,嘴炮 Pexo。 要求就几个: 100g、轻、未来感、VR 真正变成一副眼镜。 然后让它自己出脚本、拆镜头、做关键帧,再一段段生成。 哪里不对继续聊。 Pexo还能调整细节,直接用 Mark to Fix 圈出来改。 这是 Pexo 跟我在展会上看到一堆视频工具,最大的区别。 现在这个行业太卷了: Veo、Kling、Seedance、万相……模型一大堆。 15 秒、30 秒、不同分辨率、不同价格、不同积分…… 普通用户哪有空天天研究这些破玩意。 一个真正有用的镜头,可能就 3~5 秒。 该用哪个模型,让 Agent 自己选。 该拆成几个镜头,让 Agent 自己想。 Motion、重生成、剪辑、音乐、字幕…… 这些东西最好都别让我看到。 AI 视频公司越多,Pexo 这种产品反而越有意义。 把这一堆 AI 视频工具,全藏到一个 Agent 后面。

实践哥 Li

112,602 Aufrufe • vor 5 Tagen

MinLiBuilds's profile picture

3D 打印任务:Sol 14分钟 VS Step 5 Preview 54分钟。 猜猜哪个差点没打印出来? 这次我参与了 Step 5 Preview 的提前评测。 没有跑传统 Benchmark,我直接拉来 GPT-5.6 Sol,让两个模型用 Computer Use 干一个真的会翻车的任务: 照着参考图,在 Blender 里做一只 8cm 弹簧毛毛虫,最后直接拿去 3D 打印。 两边环境完全一样: pi coding agent + Computer Use + Blender 5.2.1 + 1M Context,Thinking 各自最高档。 要求也很简单: 做出来,而且真的能打印。 🚀结果速度差得非常夸张。 Sol:14分34秒。 Step 5 Preview:54分40秒。 我一开始都以为 Sol 赢麻了。 结果真把 STL 丢进打印机以后,反转了。 Step 5 Preview给毛毛虫做了完整、平整的底面,整个模型贴床很稳,顺利打印完成。 Sol 则主要靠几个小脚接触热床,底部明显拉丝,打印的时候看得我都有点慌,差点翻大车。 🔥更有意思的是 Step 5 Preview整个执行过程。 首发,刚上线涌入太多人了,测起来需要一些时间等待。 它第一轮Thinking 就接近 17 分钟。 后面为了尾巴上的 StepFun,自己用贝塞尔曲线一点一点抠字。 真的非常认真。 当然也有点好笑: 因为模型只有 8cm,最后真打印出来以后…… Logo 太小,其实也没多清楚。😂 🤔以前测 Agent,代码跑通、文件生成,基本就算完成。 可一旦进入物理世界,事情完全不一样。 Blender 里看着没问题,不代表真能打出来。 底面够不够稳、有没有悬挑、哪里会拉丝、模型到底能不能站住…… 很多东西都需要 Agent 自己判断、自己检查。 所以这次 Step 5 Preview虽然花的时间更多, 但它给我的感觉更像是在做一件事: 不是赶紧把任务“做完”,而是尽量把东西“交付出来”。 速度当然重要。 但真的进入物理世界以后, 知道哪里值得多检查一次,可能比早 40 分钟交卷更重要。 我后面又跑了一轮实验。 我把底面、悬挑、可打印性明确写进 Prompt,两边其实都做得挺好。 Sol 那次不是不会,是太自信,14 分钟就急着下班了。 Step 5 Preview这次虽然慢,但也因此多检查了一些真正影响打印的东西。 全过程、最终打印效果,我都放视频里了。

实践哥 Li

87,188 Aufrufe • vor 9 Tagen

MinLiBuilds's profile picture

无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:

实践哥 Li

91,610 Aufrufe • vor 12 Tagen

MinLiBuilds's profile picture

何同学的 iPhone 18 Pro 宣传片夯爆了。 他这个视频到底用了什么模型?传统 CG 艺术家也太强了。 这种以前明显要导演 + 剪辑 + 动效 + CG 才能做的片子,现在普通人能不能拿 AI 搞? 刚好最近我在测一个 AI 视频产品 Pexo。 我直接 0 帧起手,嘴炮 Pexo,跟它边聊边把视频做出来。 🔥 开始我就提要求,我要一支运动鞋广告。镜头钻进鞋子内部,鞋底液态成型、鞋面现场织出来、鞋带自己穿孔。 几十只鞋在流水线上狂奔,最后一只直接“跑”到真人脚上,再收一个干净的产品特写。 先看鞋款设计图和关键帧,确认样子,再看“镜头钻进鞋里”这段转场。方向对了,继续往下做。 当然,镜头出来也不是直接交卷。 比如“鞋跑到脚上”这一段,中间有版鞋飞过去了,脚却没套进去。镜头再炫,鞋没穿上也得重做。 画面里有哪个地方想改,还能用 Mark to Fix,直接圈出来,在右边的批注框里写清楚要求,再提交修改。跟给文档留批注差不多。 最后做出来,是一条 31 秒的完整视频。 🔥以前我做 AI 视频特别喜欢干一件蠢事:上来先选 15 秒、30 秒,选最好最贵的模型。 现在回头看:全他妈浪费钱。😂 一个镜头真正有用的部分可能就 3~5 秒。 比如鞋底成型,4 秒已经结束了。 你偏要生成 15 秒,后面 11 秒模型只能开始自己发挥: 鞋开始变形、镜头开始乱飘。 最后你花了 15 秒的钱,真正剪进成片的可能只有 4 秒。 包括不同的生成镜头,也不是一个模型全部包圆。 Seedance、Kling、Hailuo 本来就各有所长。 Pexo爽点在,终于不用为了做一条视频,先把各家模型研究一遍了。 剩下的模型选择、镜头拆分、生成、Motion、剪辑、音乐、字幕…… 让 Pexo 自己折腾。 这次我就是一张运动鞋都没有给。 最后硬是嘴炮出了一支广告。😂 我的制作过程全部开源了。 免费粉丝福利,100视频积分获取👇

实践哥 Li

31,233 Aufrufe • vor 5 Tagen

MinLiBuilds's profile picture

第一次有种感觉:昨天花时间教 AI,没白教。 最近玩 Today AI,让我最爽到的就是这个。 我让它参考苹果官网,给 Microduck 机器人做产品页。 🔥第一轮翻车:大标题、留白都有,产品图没了,卡片错位。苹果的骨架,灰色的占位块。 🔥修复版补齐主视觉、参数区和四张商品卡,排版也保住了 🔥隔天我换了个题:“同样的风格,做个 卖SpaceX 的网站。” 没重贴参考,深色主视觉、参数布局、大标题的节奏接上了,Today 一次成稿。 终于有种“昨天没白教”的感觉。 更有意思的是后面。 第二天我还没开始输新 Prompt,它在说早安时主动提出: “Microduck 页面还有一个待确认项:移动端卡片布局。如果今天继续测试,建议先确认这个。” 这一下感觉就不一样了。 它甚至已经知道,接下来该干什么。 🚀 我们纠正 AI 的经验,到底怎么留下来? 给 Agent 写 CLAUDE.md、配 Skills,就是把背景、规则、流程放在模型外面,需要时读进上下文。这类“外脑”,很多时候还得我们自己整理、维护。 Today 会把人物、项目、偏好、约定整理成结构化记忆,跨会话、跨设备保留,供后续任务检索使用。 我期待的就是这种“做梦”体验:白天一起干活,把踩过的坑、确认过的要求留下来,第二天配合得更顺。 🔥写内容,能不能沿用我确认过的口吻? 跟项目,能不能少让我重讲一遍背景? 这些比一次做出漂亮网页,更有价值。 甚至在我没开口时,它能预判到我的预判,直接推进下一步。

实践哥 Li

58,955 Aufrufe • vor 22 Tagen

MinLiBuilds's profile picture

99% of iPhone users don’t know this: Their phone already has a free music production powerhouse hidden inside. It’s one of the treasures left behind from the Steve Jobs era. Millions of people own an iPhone, iPad, or MacBook — but have never truly opened it. I asked an AI Agent to create a completely new piece of music from scratch. The result surprised me. It wasn’t just generating audio. It could be edited. Sounds, channels, tracks — everything was adjustable. But I didn’t ask AI to generate an MP3. Instead, I asked it to create a: structured, editable, and extendable music project. The model had to understand: 🎹 Main melody 🎻 Harmony relationships 🥁 Rhythm design 🎸 Instrument arrangement 🎼 Multi-track structure The final output was MIDI, which was imported directly into GarageBand. And this reveals a key difference: Traditional AI music tools like SUNO often generate the final audio directly. You get an MP3. It sounds good, but it’s difficult to modify. MIDI is like the Python of the music world. And this is exactly where Ling-3.0-flash Ant Ling shines. It works like a high-speed execution engine in an AI workflow: ⚡ Low latency 💰 Cost-efficient 🔧 Stable tool calling It can transform complex plans into real outputs quickly. In this music creation workflow, it can independently handle: •Which instruments should play •Which notes should be combined •How rhythms should evolve •How different tracks should interact After importing into GarageBand, you can: ✅ Edit the melody ✅ Replace instruments ✅ Adjust tempo ✅ Re-arrange the composition ✅ Add your own creativity I was genuinely impressed by the result. Try it.

实践哥 Li

140,444 Aufrufe • vor 2 Monaten

MinLiBuilds's profile picture

Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。

实践哥 Li

66,035 Aufrufe • vor 1 Monat

MinLiBuilds's profile picture

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。 我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。 接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。 🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。 「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。 Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。 🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。 两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿 Qwen3-4B 当初始化权重,连同音频编码器一起全参数微调。 我把它的解码器和原版 Qwen3-4B 逐层比对过,每一层都有变化。所以不是白嫖 Qwen 的语言知识,避免了从零预训练语言能力。这条路叫 Encoder-Adapter-LLM。 最后还有一个牛逼的点: Open ASR Leaderboard全球第 7,开源多语言 ASR 第 1。 五语种平均 WER 3.54%,而且权重开放、评测公开、结果可复现。 现已支持四川话、广东话小语种。 Apache 2.0 开源。

实践哥 Li

47,158 Aufrufe • vor 26 Tagen