产品经理老王霸's banner
产品经理老王霸's profile picture

产品经理老王霸

@laowangbabababa • 10,591 subscribers

🏫前Top2大厂AI产品经理 ,熟悉AI底层原理 📚《电商产品经理》作者 ,独立开发者 🏫 公众号:产品经理老王霸,长文都在这里 👀 分享AI出海,AI实操分享,AI 编程经验和踩坑分享 🔥 企业AI培训 | AI 工具推广,V: pmlaowangba

Shorts

卧槽,我用MinimaxH3也复刻出来白模的舞蹈视频了。刚看到了李岳 李岳老师也发过类似的视频,非常棒。 整个制作过程,动作复刻最难还原的,通过人工的口述提示词的形式,很难形容复杂的动作和微末的表情变化。 此刻我们必须使用白模演示动作,用参考图把人物和场景替换上去。 具体的方法,看评论区👇:

卧槽,我用MinimaxH3也复刻出来白模的舞蹈视频了。刚看到了李岳 李岳老师也发过类似的视频,非常棒。 整个制作过程,动作复刻最难还原的,通过人工的口述提示词的形式,很难形容复杂的动作和微末的表情变化。 此刻我们必须使用白模演示动作,用参考图把人物和场景替换上去。 具体的方法,看评论区👇:

83,265 次观看

卧槽,外链跳转微信加好友,被我打通了。 全程用codex ,从链接,跳转到微信app扫码,加微信的流程。从各种网站,获客的线索终于可以不会丢失了。 我看了其他网站做的这样产品,月费至少是99,我只有认证费和服务器的成本。 参考这个视频看看,对这个感兴趣的可以私聊我

卧槽,外链跳转微信加好友,被我打通了。 全程用codex ,从链接,跳转到微信app扫码,加微信的流程。从各种网站,获客的线索终于可以不会丢失了。 我看了其他网站做的这样产品,月费至少是99,我只有认证费和服务器的成本。 参考这个视频看看,对这个感兴趣的可以私聊我

174,118 次观看

seedance2.5+白模的形式,直接复刻经典动作大片,非常的牛掰。 1、先捕捉原素材的动作,生成白模素材 2、生成要替换的角色图2个 3、素材图+白模一起发给seedance,评论区看提示词 4、看下面成片即可,是不是很简单

seedance2.5+白模的形式,直接复刻经典动作大片,非常的牛掰。 1、先捕捉原素材的动作,生成白模素材 2、生成要替换的角色图2个 3、素材图+白模一起发给seedance,评论区看提示词 4、看下面成片即可,是不是很简单

50,330 次观看

我去,美团把数字人视频生成模型开源了。外面数字人 Agent 一天卖 50 万,美团直接做了个 LongCat-Video-Avatar 塞进同一个仓库里开源了。 给一张人脸图加一段音频,数字人张嘴念稿,嘴唇、眼神、表情全自动对上。 它不是那种玩具开源,是实打实对标 Sora、Veo3、Kling 那种商业模型。 13.6B 参数,文生视频、图生视频、视频续写,一个模型全干完,720p 30 帧,长视频一口气跑几分钟不崩画质。而且你敢信?推理还比同级快了 10 倍。 坦率的讲,我看到技术报告的时候是有点懵的。因为 benchmark 上它一个 Dense 架构的 13.6B 模型,追着人家 28B 的 MoE 打。更让我愣住的是数字人那块。 你想想看,这事以前怎么搞。 要么自己录真人,要么掏钱买方案,几百块一条起步。现在一个开源模型,丢段文案给 TTS 一念,画面它自己出。而且 1.5 版做了蒸馏,推理从几十步压到 8 步,快了 15 倍。还加了 INT8 量化省显存。 说实话,这种东西别只收藏。 想试的,先跑 一下我下面的文章教程,参考就能部署。 GitHub 搜 meituan-longcat / LongCat-Video,权重在 HuggingFace 上直接下。

我去,美团把数字人视频生成模型开源了。外面数字人 Agent 一天卖 50 万,美团直接做了个 LongCat-Video-Avatar 塞进同一个仓库里开源了。 给一张人脸图加一段音频,数字人张嘴念稿,嘴唇、眼神、表情全自动对上。 它不是那种玩具开源,是实打实对标 Sora、Veo3、Kling 那种商业模型。 13.6B 参数,文生视频、图生视频、视频续写,一个模型全干完,720p 30 帧,长视频一口气跑几分钟不崩画质。而且你敢信?推理还比同级快了 10 倍。 坦率的讲,我看到技术报告的时候是有点懵的。因为 benchmark 上它一个 Dense 架构的 13.6B 模型,追着人家 28B 的 MoE 打。更让我愣住的是数字人那块。 你想想看,这事以前怎么搞。 要么自己录真人,要么掏钱买方案,几百块一条起步。现在一个开源模型,丢段文案给 TTS 一念,画面它自己出。而且 1.5 版做了蒸馏,推理从几十步压到 8 步,快了 15 倍。还加了 INT8 量化省显存。 说实话,这种东西别只收藏。 想试的,先跑 一下我下面的文章教程,参考就能部署。 GitHub 搜 meituan-longcat / LongCat-Video,权重在 HuggingFace 上直接下。

173,926 次观看

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

55,220 次观看

如果你在 X 上不知道做啥赛道,那我推荐你干一下资料分享+网盘拉新。 比如 白骏知识分享 白老师和 周览资源 周老师 都是这方面的顶流。做这赛道有几方面优势。 1、流量大,粉丝喜欢,很容易起号,粉丝量也会起的很猛。周老师大概不到半年涨了快 8w 粉丝。而且,谁不愿意收藏干货啊,好的资源免费获得,看到就想直接收藏。 2、X 上可以随便发链接,不像国内平台,要躲躲藏藏的。大大方方的放到正文,评论区,用户获取资料链路极短,非常方便。 3、每发帖,必来钱的,别看不上每次块八毛的,积少成多啊,你看我自己的拉新数据,逐年累月也 一千多了。 也适合做其他事情的时候,一顺手分享,还有的赚。快去试试

如果你在 X 上不知道做啥赛道,那我推荐你干一下资料分享+网盘拉新。 比如 白骏知识分享 白老师和 周览资源 周老师 都是这方面的顶流。做这赛道有几方面优势。 1、流量大,粉丝喜欢,很容易起号,粉丝量也会起的很猛。周老师大概不到半年涨了快 8w 粉丝。而且,谁不愿意收藏干货啊,好的资源免费获得,看到就想直接收藏。 2、X 上可以随便发链接,不像国内平台,要躲躲藏藏的。大大方方的放到正文,评论区,用户获取资料链路极短,非常方便。 3、每发帖,必来钱的,别看不上每次块八毛的,积少成多啊,你看我自己的拉新数据,逐年累月也 一千多了。 也适合做其他事情的时候,一顺手分享,还有的赚。快去试试

24,282 次观看

codex 生成这样的视频,15s,耗时 1.5h,效果还行,就是太太太太慢了。 如果想让我做到批量自动化,这样效率着实不行。 如果调用第三方生视频接口,2 分钟内就完事了。动画科普,不需要那么贵的模型就可以搞定。5s720p 大概 5 毛钱左右。

codex 生成这样的视频,15s,耗时 1.5h,效果还行,就是太太太太慢了。 如果想让我做到批量自动化,这样效率着实不行。 如果调用第三方生视频接口,2 分钟内就完事了。动画科普,不需要那么贵的模型就可以搞定。5s720p 大概 5 毛钱左右。

22,023 次观看

复杂动作的复刻只用提示词是很难完整还原的,所以需要到白模做参考复刻。 白模是一套没有任何材质贴图的三维灰模。人物是胶囊体和方块,场景是简单几何体,不打光,不上色,不贴图。 画面上剩下的只有三样。人物在空间里的位置,人物的运动轨迹,机位的运动轨迹。 白模生成需要提供一段原素材,这个视频我给的是迈克尔杰克逊的舞蹈。你使用LibTV也好,Codex也好,都能生成白模。 内容太长,完整流程看评论:

复杂动作的复刻只用提示词是很难完整还原的,所以需要到白模做参考复刻。 白模是一套没有任何材质贴图的三维灰模。人物是胶囊体和方块,场景是简单几何体,不打光,不上色,不贴图。 画面上剩下的只有三样。人物在空间里的位置,人物的运动轨迹,机位的运动轨迹。 白模生成需要提供一段原素材,这个视频我给的是迈克尔杰克逊的舞蹈。你使用LibTV也好,Codex也好,都能生成白模。 内容太长,完整流程看评论:

11,239 次观看

如果本地机器比较差,可以考虑云端部署模型,大概 3 元每小时,随时关机,用的时候开一下。 性价比拉满,具体细节,参考下面文章👇

如果本地机器比较差,可以考虑云端部署模型,大概 3 元每小时,随时关机,用的时候开一下。 性价比拉满,具体细节,参考下面文章👇

15,975 次观看

又找到了一晚上卖50w的AI视频项目,我已经部署到本地生成了视频,他不是个客户端,是类似于一堆skill的文件包。 老王之前做一条三分钟产品片子,找素材两天,排节奏一天,加字幕又一天。一个团队折腾一周。 然后我遇到了 OpenMontage。 说实话一开始没抱什么期望。开源视频工具,见多了,十个有八个是套壳。结果跑了一条,调研了grok的api一条命令,三分钟出了三段能直接发的片子。效果很炸。 它到底是个啥。 把你的 Claude 或 Cursor 变成视频制片人。你对着它说一句「做个 60 秒黑洞科普」,它自己去翻论文、写脚本、生成图表动画、扒免费素材、配字幕音乐,最后渲染出片。 不是你点按钮选模板,是每一步它自己做判断。 拆开看三件事。 第一,12 条流水线各管一种片型。explainer 做科普片,clip 做混剪,music 做 MV,data 做数据图表动画。你选对流水线,出来的结构就对了一半。 第二,每条流水线底下是一串 agent Skill——怎么查资料、怎么写分镜、什么时候加转场、字幕压在哪帧。500 个 Skill 叠出来的不是模板库,是决策链。你描述得越具体,它判断得越准。指令模糊,出来的也只能是模糊的东西。 第三,零密钥就能跑。不配任何 API,本地免费模型直接出片。付费版 Runway 干的活它全包了。 我做内容这些年最烦的不是没创意。是找素材卡半天、排节奏卡半天、字幕又卡半天,三个半天过去热情全没了。这东西把执行链里所有决定让 agent 替你做了,你只负责描述要什么。 怎么上手?很简单 我没可以生视频的Key,用网页调用supergrok的Oauth,和OpenMontage结合生成的弹唱视频,整体还是比较满意的。

又找到了一晚上卖50w的AI视频项目,我已经部署到本地生成了视频,他不是个客户端,是类似于一堆skill的文件包。 老王之前做一条三分钟产品片子,找素材两天,排节奏一天,加字幕又一天。一个团队折腾一周。 然后我遇到了 OpenMontage。 说实话一开始没抱什么期望。开源视频工具,见多了,十个有八个是套壳。结果跑了一条,调研了grok的api一条命令,三分钟出了三段能直接发的片子。效果很炸。 它到底是个啥。 把你的 Claude 或 Cursor 变成视频制片人。你对着它说一句「做个 60 秒黑洞科普」,它自己去翻论文、写脚本、生成图表动画、扒免费素材、配字幕音乐,最后渲染出片。 不是你点按钮选模板,是每一步它自己做判断。 拆开看三件事。 第一,12 条流水线各管一种片型。explainer 做科普片,clip 做混剪,music 做 MV,data 做数据图表动画。你选对流水线,出来的结构就对了一半。 第二,每条流水线底下是一串 agent Skill——怎么查资料、怎么写分镜、什么时候加转场、字幕压在哪帧。500 个 Skill 叠出来的不是模板库,是决策链。你描述得越具体,它判断得越准。指令模糊,出来的也只能是模糊的东西。 第三,零密钥就能跑。不配任何 API,本地免费模型直接出片。付费版 Runway 干的活它全包了。 我做内容这些年最烦的不是没创意。是找素材卡半天、排节奏卡半天、字幕又卡半天,三个半天过去热情全没了。这东西把执行链里所有决定让 agent 替你做了,你只负责描述要什么。 怎么上手?很简单 我没可以生视频的Key,用网页调用supergrok的Oauth,和OpenMontage结合生成的弹唱视频,整体还是比较满意的。

16,536 次观看

这个数字人吧,差强人意了,绝对不能直接口播的形式,穿插一些素材,或者小窗口还凑合。 但是项目功能比较完整,适合自己手搓,二开叠加功能。

这个数字人吧,差强人意了,绝对不能直接口播的形式,穿插一些素材,或者小窗口还凑合。 但是项目功能比较完整,适合自己手搓,二开叠加功能。

11,701 次观看

Videos

laowangbabababa's profile picture

我靠,原来抖音一晚上卖 50w 的数字人,都是基于这个项目开发的。叫MoneyPrinterTurbo,7.4 万 star。 输个主题,AI 写文案、自动从 Pexels 扒无版权素材、配音、加字幕、配 BGM、合成出片。 我已经部署到自己的mac 电脑,并拿山海经 12 祖巫的故事跑了1次, 还挺好玩,只需要输入一个标题,出来的视频成品基本不用改。 LLM 写稿、TTS 配音、素材搜索、字幕识别、视频合成,五条互不搭边的技术链路,被它串成了一条自动化流水线。每一步的提供商都是可配置的。 拆开看,总共有这几个能力可供我们学习: → 脚本层:接了 15 种大模型,内置 20 多套爆款模板,支持中文 → 素材层:自动跑 Pexels 扒无版权视频,也能往里扔自己的素材 → 配音层:9 种语音合成方案,Edge TTS 免费,Azure 和 ElevenLabs 可切 → 字幕层:Whisper 做精准对齐,Edge 做快速生成,字体大小颜色随便调 → 合成层:MoviePy 把所有东西拼成一条高清视频,竖屏横屏都行 对电脑配置很低,CPU 就能跑,根本不用显卡。还自带的 Web 界面,也能用 API 和命令行。讲真,这配置对普通电脑来说挺友好的。 想做内容的,不想露脸,就先把仓库 clone 下来跑通一条视频,看看它怎么把五步串成一步。 做开发的,抄它的模块化思路。插件式架构加多方案可替换,自己项目里就能用这套拆法。 别只收藏啊,你看老王搞得成片,是那么个意思了。然后,你拆一遍它的流水线怎么搭的,比收藏 100 个工具值。

产品经理老王霸

183,906 次观看 • 3 个月前

laowangbabababa's profile picture

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。

产品经理老王霸

90,306 次观看 • 2 个月前

laowangbabababa's profile picture

GPT-6 Astra的3D建模能力增强很大,为了了解他的模型能力,我直接在ZenMux上跑完和Claude Fable 5.1的3D游戏对比测试。 就一句话:做个能玩的3D水族馆游戏。 他们都可以直接生成能玩的游戏,包括驾驶飞船,鱼缸、鱼群、投喂等等。 老王挑这个测试是有原因的。因为,静态页面AI能糊弄下,但游戏糊弄不了啊,鱼要游,状态还得跟着时间走,这样才能测试出模型的能力。 整体输出的对比结果上,GPT-6Astra的能力还是占优的。 1、3D能力都是非常的强悍,能够100%还原需求。 2、GPT-6 Astra在提示词拆解上做的更优,会更加详细的梳理用户意图并分解执行工具,当然也会导致输入token变多,首Token延迟大一些。 3、GPT-6Astra的页面丰富度更好,页面的纹理,物体的反光,光暗颜色更加贴近真实情况。 成本那块,老王在ZenMux上拉了两个模型同台对比, 1、同一个任务,GPT-6 Astra,输入 64,683,输出 35,408。Claude 输入 105,738,输出 28,363。每 1 万 token 输入的产出,Codex 约 5.5k,Claude 约 2.7k,差一倍多。也导致了,GPT-6 Astra输出的作品细节更加丰富了一些。 2、GPT-6 Astra延迟 142 秒,Claude 9 秒。总耗时 563 秒对 295 秒。前者思考时间更长,执行任务更久,内容提示词延展的更多一些。 大家拿自己的任务再跑一遍,ZenMux一个key后面挂多家模型,换模型不换代码,我做这样的对比测试都非常的方便。 最近9.4-9.11,有充值活动,充 $50 到手 $70,充 $100 到手 $150,每个账号限兑一次。 想使用的同学,可以来这里注册:

产品经理老王霸

15,556 次观看 • 19 天前

laowangbabababa's profile picture

张雪峰真是大善啊,高考孩子有福气了。张雪峰老师虽然走了,他那套帮人选专业的核心认知全在。 有人干了一件特别牛逼的事。把张雪峰十年直播里反复用的那套判断框架,蒸馏成了一个开源的 AI Skill。5本书、15篇采访、30多条语录,一层一层提炼出5个心智模型:社会筛子论、就业倒推法、阶层现实主义、不可替代性检验。 我给你翻译一下这是什么意思。 你问它一个问题,它不是说一堆正确的废话。而是先查你有没有行业资源,再看这个专业毕业生中位数的去向,最后给你一个你够得着的方向。 不讲鸡汤。不画大饼。 老王把这东西接成了免费的高考答疑AI工具,现在谁都能用,网址: 模型全免费,你直接提问就行。 三个场景,我说说有多实用。 第一种,正填志愿的考生。拿分数、省份、想报的专业,三个要素丢过去。它按中位数去向给判断,告诉你这个分段能去哪、出来做什么、值不值得去。 第二种,孩子要选专业的家长。这也是张雪峰直播间十年反复问的一套逻辑——先别问什么专业好,先问你家里有什么行业资源,再去看这个行业出口在哪。工具会按这个顺序反过来问你。 第三种,纠结考研还是工作的。它会先问你什么专业。不同专业,答案完全不一样。学计算机的和学生物的,走的路能一样吗。 但说真的,这东西真正值钱的,不是回答本身。 是一个人的认知框架,被保留下来、被复用、被放大了。 你想想看,张雪峰做了十年直播,核心就五六个判断模型,翻来覆去地用。现在这些模型结构化地写进了 Skill 文件,谁装上,谁就继承了这套判断逻辑。代码是死的,判断是活的。 志愿这件事,信息差就是命差。 张雪峰不在了,这套框架没走。

产品经理老王霸

43,603 次观看 • 3 个月前