
产品经理老王霸
@laowangbabababa • 10,591 subscribers
🏫前Top2大厂AI产品经理 ,熟悉AI底层原理 📚《电商产品经理》作者 ,独立开发者 🏫 公众号:产品经理老王霸,长文都在这里 👀 分享AI出海,AI实操分享,AI 编程经验和踩坑分享 🔥 企业AI培训 | AI 工具推广,V: pmlaowangba
Shorts
Videos

太牛逼了。真的,太牛逼了。真的能爬一切,而且速度嘎嘎快! 以前让 Claude Code 上网搜个东西,推特 API 要钱,网页抓取要订阅,B站小红书直接给你拦在外面。每个平台一个门槛,烦得要死。 Agent-Reach,一个免费开源仓库,一条命令把这 14 个平台全通了。 我装上跑了一遍 ,让 Agent 去搜一条小红书任意帖子的评论并总结,十秒总结出来,我当时真愣了一下,又快又好啊。 讲道理,Agent 能写代码能改文档,上网找东西就一直卡在这。Agent-Reach 干的就一件事,把选型和配置全帮你做完了。 yt-dlp 提字幕,twitter-cli 搜帖子,xhs-cli 抓小红书,装好以后 Agent 自己调,不经中间层。哪块不好用随时换。 零配置直接跑的有网页、YouTube、RSS、公众号、微博、V2EX。不用记命令,直接说需求,Agent 自己知道走哪。 >安装方法: 跟你的大模型说: 帮我安装 Agent Reach
产品经理老王霸426,986 views • 3 months ago

又捡到一个宝。 几百封投实习的简历邮件,我人工一封封看,下载要一下午,被网易邮箱大师里免费内置的 Mail Agent 几秒筛完了。 我拿手头一批实习生简历邮件试了试,让它按学校和实习经历,对比我的招聘JD,给简历排优先级打分,并生成HTML报告。网易的AI邮件助理立刻行动,理解我的意图,一分钟时间就干完了,关键是免费额度非常慷慨。 但我觉得最值钱的地方, 它是在邮箱里直接读完整数据。几百封邮件,每一封的原文它都过了一遍,才给你出筛选结果。人用眼睛翻,翻到后面记不住前面,漏了、看串了都正常;它基于完整原文,可以按时间点建知识库,所以数据非常准,远不是外部的agent可以比拟的。 我拆了拆它实际干的活,就四件事: 1、筛,垃圾邮件、群发通知先清掉,剩下的按紧急程度排队 2、整,几十封往来邮件按时间线拉成进度表 3、写,周报、客户跟进记录、回信、简历,PPT等,一句话生成还能导出 4、建,把近期的邮件自动建成知识库,随时问去年和谁合作过、论文格式要求是什么,都能精准回答 如果你还不会怎么操作,可以看我的讲解视频,或者留言。
产品经理老王霸141,341 views • 1 month ago

震惊了,终于有人把 GitHub 说清楚,哦对,就是我说的,哈哈,非常适合小白阅读。这是一期 github 的奶爸级别教学。如果你是AI编程爱好者,这视频对你帮助极大的。 GitHub有多牛?它有1.8亿开发者,至少6亿以上的仓库数量。你知道的腾讯,阿里,字节的开源项目全部都会放到GitHub上。 上面内容五花八门,全部开源免费,比如有最近爆火的openclaw,有数字人,有skill仓库,有电商系统等等 他可不是程序员专属,因为AI编程能力变强了,现在几乎要人手一个GitHub的,接下来我带你学习它的核心功能,包括 > 怎么注册使用GitHub > 怎么跟从GitHub下载项目 >如何上传GitHub项目
产品经理老王霸257,063 views • 3 months ago

震惊了,抖音上祁博士一天卖 50w 的数字人 agent,我2 分钟就开发完成了。 用的就是Pixelle-Video这个项目,已经22k stars。包括数字人口播、动作迁移、图生视频全支持。 支持ComfyUI,输入主题,从写脚本到加 BGM 到出片,一条龙自动跑视频。 老王部署到本地,做了个简短的视频,属于插图式的视频,如果你需要更复杂的视频,需要自己配置云端模型比如 seedance2,kling 等等。 Pixelle-Video 最厉害的地方,是它把视频生产完全做成了可配置,支持本地部署模型和云端大模型。 文案、画面、配音、剪辑,它拆成四个可替换的模块,每块后面都能换模型,可以自由切换模型,使用非常方便 >文案层:LLM 读主题,吐出带时间戳的结构化脚本,每>句对应一段画面。 >画面层:脚本每句转生图提示词,扔给 ComfyUI 或直连 DashScope 出图,图生视频和数字人口播也走这一层。 >语音层:脚本原文走 TTS 合成,多语言加音色克隆,不用自己录音。 >合成层:画面对齐语音时间轴,叠上 BGM,输出 MP4。 仓库: P.S. 想到了就能出片,懂一点 AI 编程,这个项目就能自己做成适合各行业的数字人 agent。
产品经理老王霸200,623 views • 3 months ago

我靠,原来抖音一晚上卖 50w 的数字人,都是基于这个项目开发的。叫MoneyPrinterTurbo,7.4 万 star。 输个主题,AI 写文案、自动从 Pexels 扒无版权素材、配音、加字幕、配 BGM、合成出片。 我已经部署到自己的mac 电脑,并拿山海经 12 祖巫的故事跑了1次, 还挺好玩,只需要输入一个标题,出来的视频成品基本不用改。 LLM 写稿、TTS 配音、素材搜索、字幕识别、视频合成,五条互不搭边的技术链路,被它串成了一条自动化流水线。每一步的提供商都是可配置的。 拆开看,总共有这几个能力可供我们学习: → 脚本层:接了 15 种大模型,内置 20 多套爆款模板,支持中文 → 素材层:自动跑 Pexels 扒无版权视频,也能往里扔自己的素材 → 配音层:9 种语音合成方案,Edge TTS 免费,Azure 和 ElevenLabs 可切 → 字幕层:Whisper 做精准对齐,Edge 做快速生成,字体大小颜色随便调 → 合成层:MoviePy 把所有东西拼成一条高清视频,竖屏横屏都行 对电脑配置很低,CPU 就能跑,根本不用显卡。还自带的 Web 界面,也能用 API 和命令行。讲真,这配置对普通电脑来说挺友好的。 想做内容的,不想露脸,就先把仓库 clone 下来跑通一条视频,看看它怎么把五步串成一步。 做开发的,抄它的模块化思路。插件式架构加多方案可替换,自己项目里就能用这套拆法。 别只收藏啊,你看老王搞得成片,是那么个意思了。然后,你拆一遍它的流水线怎么搭的,比收藏 100 个工具值。
产品经理老王霸183,906 views • 3 months ago

我去,又发现一个非常厉害的产品。这数字人口播做的太太逼真了,特效质量做的非常高,完全超出我预期,它就是Fotor Agent Fotor 剪口播的人应该都明白,删赘词、补 B-roll、对字幕、找配乐,一条三五分钟视频大半天都搞不定的。 你跟AI对话,要这特效,那个金句卡片,生成耗时很久,还永远不满意。 那你真要试试这个产品,它在AI剪辑能力上,非常夯。我已经测了: → 语义剪辑,听完整段口播,口误、重复、废话先砍掉,再从内容里提高光,节奏等素材 → MG 动效,科普片里 Agent、流程图、行业名词,自动补矢量动画和转场,不用先去学习AE了 → 一键编排,字幕、配乐、B-roll、转场按内容语义排布,AI粗剪完,我们人工还能手改 → 可编辑迭代,不满意就在对话框调一轮,改一版不用重新从零对时间轴,大大的提效。 老王把一段文案和自己的形象,做个数字人口播,发给Fotor Video Agent,它做了这几块操作: 1、听懂文案:按语义切段,删口误和废话,标出重点 2、自动成片:口播画面、B-roll、MG 动效、字幕、配音、配乐一起排好,卡点不用手搓的 3、可改可导出:操作台里换镜头、改字幕、调动效,满意再出正片 大家可以看一下AI生成和剪辑的效果
产品经理老王霸21,809 views • 12 days ago

有人把 MiniMax 语音克隆和 HeyGen 数字人出镜,写成了一个 Agent Skill。 用法不复杂。 给它一张正面肖像,一段声音样本,一份脚本。Agent 拿到先不干活,先看声音格式对不对,文件大小超不超,肖像够不够清晰。 有一项没过就会停下,不会让你付了 API 调用的钱才发现素材有问题。 校验过了才进正式流程。MiniMax 做语音克隆生成旁白,HeyGen 拿图片驱动视频。 你可以先出一版 15 秒 720p 预览视频,仔细看口型、面部变形、眨眼幅度。确认没问题,再生成 1080p 成片。 出错后的恢复策略也做得特别好。API 超时不直接判失败,下载失败只重试下载不重开任务,签名链接过期不另起新请求。每次出问题优先用已有结果恢复,而不是再来一遍付费调用。 把校验、重试、状态追踪这套产线逻辑,写成 Agent 能执行的指令。 下面是作者的视频,很哇塞 Rachel🥥
产品经理老王霸76,146 views • 1 month ago

又淘到一个学英语狠项目,我深度体验了一下,非常好用,百词斩、多邻国付费版做的事,这个免费项目全包了。 它把背单词拆成了四个阶段。从跟打到听写,到自测,再到默写,层层递进。 市面上大部分工具只做到第一阶段:让你认。TypeWords 推到第四阶段,这是它的特殊优势。 它用的 ts-fsrs 间隔重复算法,根据你每次敲对敲错的速度,动态算下一次什么时候该见这个词。跟那种按固定天数推复习的,是代差的区别。 → 考雅思托福的,跟打先带你过拼写,听写遮住原词让你打,自测看中文敲英文。三关下来这个词长进肌肉里了。 → 背 GRE 考研的,FSRS 算法根据每次敲对的反应速度算间隔。打错自动进错题本,隔几天推回来重打,对三次才标记掌握。 → 日常想维持英语的,文章模块支持逐句默写,导入自己材料自动翻译双语文档。边写边听边记。 想直接用的,打开 15 分钟,一周拼写记得嘎嘎清楚。 做英语学习产品的,去翻它的源码。自己去部署,开发新的网站。 仓库: 上手: P.S. 下次有人说学英语靠坚持,把老王这条帖子甩过他脸上
产品经理老王霸153,263 views • 3 months ago

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。
产品经理老王霸90,306 views • 2 months ago

经过老王多日的研究,调研发现生成动画科普视频的 2 个方法,还算是靠谱 1、多图层动效法。一次性把图片生成,包括主体图片,标签,数字,重点,文字等等。使用 HyperFrames 让各个图层动起来。 优点:纯免费,画面能动。 缺点:时间成本极高,每个图层都是一张图,ai 生图需要很久很久。 2、图生视频法。让视频模型负责生视频,画面会变得更加细腻,美观。每秒至少 30 帧,理论上就是 1 秒播放 30 张图片,效率比生图模型高很多。但我一直想规避这个方法,因为不太可控。 优点:画面非常棒,生成速度快 缺点:成本昂贵,1 分钟视频即使用最便宜的模型也要10 元+了,批量产出成本都收不回。而且,也需要抽卡的,幻觉很强 最后,我选择了 2 者结合的路线,图层+图生视频的方法。效果还是比较满意的。但仍然无法做到稳定。
产品经理老王霸50,172 views • 1 month ago

淘到一个狠项目。 Godot,一个 11.2 万 stars 的开源游戏引擎,MIT 协议,全免费。 Unity 一年订阅费够你雇一个程序员,但这玩意儿直接全免。它表面看是个免费游戏引擎,说白了就是 Unity 的平替。 但免费只是表面。 Godot 的 2D 引擎是它最硬的底牌。专属 2D 渲染,像素坐标直接控制,不套 3D 管线模拟。 做 2D 游戏的都懂, Unity 那套 2D 是 3D 引擎上盖了层薄皮。Godot 反过来,2D 引擎从根上就是 2D 的。节点架构也干净。场景树组织一切,一个节点一个职责。 没拿投资没收版税,纯靠社区捐赠活了 12 年。stars 货真价实,开发者都用脚投票的。 ai 时代对普通人来说,这事儿很简单:你想做游戏,以前得先凑一笔引擎钱。现在不用了。 下一个安装包,几十兆,双击打开,建项目直接开干。 官方文档里有个 Your first 2D game 教程,跟着走,30 分钟就能跑通一个会动的小角色了,看我做的小视频,在 mac 电脑运行,非常出色。而且,做出来的游戏全是你的,没人抽成,没人管你赚了多少。 别只收藏。今晚下一个编辑器,跑一遍入门教程。30 分钟你就能判断这玩意儿适不适合你的下一个项目。
产品经理老王霸98,345 views • 3 months ago

太牛比了,实在太全了。84k star、近 3 万 fork,这个电商开源项目,前后台加起来 20 多个模块全塞进去了。 外面一套像样的电商系统几十万起步,这个 Apache 2.0 随便用。商品、订单、会员、促销、统计……大厂后台有的模块,它里面全有,一个没少。 是外包电商项目的大爹!!! 它甚至还贴心的配套了一堆课程讲解,应该怎么用这个项目。从2018 年到 2026 年,8 年了还在更。大部分开源电商项目写完 CRUD 就停了,这个不一样。 你把它的模块翻一遍就知道了。 ->商品这块,品牌、分类、属性、库存,一个不少。 ->订单那边,购物车、下单、支付回调、退货流程全串好了。 ->会员体系也有,等级、积分、成长值。 ->营销那套没落下,秒杀、优惠券、满减活动都在。 ->还有报表,流量、转化、用户画像。 大厂后台有的,它全有。 说真的,照着这个结构改改,接私活起后台、团队搭中台、学 Java 练手,一个仓库够了。 老王做vibecoding课程,就拿这个做的案例,直接做了一整套电商平台。 商城是最经典的场景,订单流转、库存扣减、优惠叠加,AI 能不能把这些逻辑写对,一跑就知道。如果让 ai 从头开始写,这些底层系统着实需要花费很多功夫的。
产品经理老王霸58,519 views • 2 months ago

GPT-6 Astra的3D建模能力增强很大,为了了解他的模型能力,我直接在ZenMux上跑完和Claude Fable 5.1的3D游戏对比测试。 就一句话:做个能玩的3D水族馆游戏。 他们都可以直接生成能玩的游戏,包括驾驶飞船,鱼缸、鱼群、投喂等等。 老王挑这个测试是有原因的。因为,静态页面AI能糊弄下,但游戏糊弄不了啊,鱼要游,状态还得跟着时间走,这样才能测试出模型的能力。 整体输出的对比结果上,GPT-6Astra的能力还是占优的。 1、3D能力都是非常的强悍,能够100%还原需求。 2、GPT-6 Astra在提示词拆解上做的更优,会更加详细的梳理用户意图并分解执行工具,当然也会导致输入token变多,首Token延迟大一些。 3、GPT-6Astra的页面丰富度更好,页面的纹理,物体的反光,光暗颜色更加贴近真实情况。 成本那块,老王在ZenMux上拉了两个模型同台对比, 1、同一个任务,GPT-6 Astra,输入 64,683,输出 35,408。Claude 输入 105,738,输出 28,363。每 1 万 token 输入的产出,Codex 约 5.5k,Claude 约 2.7k,差一倍多。也导致了,GPT-6 Astra输出的作品细节更加丰富了一些。 2、GPT-6 Astra延迟 142 秒,Claude 9 秒。总耗时 563 秒对 295 秒。前者思考时间更长,执行任务更久,内容提示词延展的更多一些。 大家拿自己的任务再跑一遍,ZenMux一个key后面挂多家模型,换模型不换代码,我做这样的对比测试都非常的方便。 最近9.4-9.11,有充值活动,充 $50 到手 $70,充 $100 到手 $150,每个账号限兑一次。 想使用的同学,可以来这里注册:
产品经理老王霸15,556 views • 19 days ago

张雪峰真是大善啊,高考孩子有福气了。张雪峰老师虽然走了,他那套帮人选专业的核心认知全在。 有人干了一件特别牛逼的事。把张雪峰十年直播里反复用的那套判断框架,蒸馏成了一个开源的 AI Skill。5本书、15篇采访、30多条语录,一层一层提炼出5个心智模型:社会筛子论、就业倒推法、阶层现实主义、不可替代性检验。 我给你翻译一下这是什么意思。 你问它一个问题,它不是说一堆正确的废话。而是先查你有没有行业资源,再看这个专业毕业生中位数的去向,最后给你一个你够得着的方向。 不讲鸡汤。不画大饼。 老王把这东西接成了免费的高考答疑AI工具,现在谁都能用,网址: 模型全免费,你直接提问就行。 三个场景,我说说有多实用。 第一种,正填志愿的考生。拿分数、省份、想报的专业,三个要素丢过去。它按中位数去向给判断,告诉你这个分段能去哪、出来做什么、值不值得去。 第二种,孩子要选专业的家长。这也是张雪峰直播间十年反复问的一套逻辑——先别问什么专业好,先问你家里有什么行业资源,再去看这个行业出口在哪。工具会按这个顺序反过来问你。 第三种,纠结考研还是工作的。它会先问你什么专业。不同专业,答案完全不一样。学计算机的和学生物的,走的路能一样吗。 但说真的,这东西真正值钱的,不是回答本身。 是一个人的认知框架,被保留下来、被复用、被放大了。 你想想看,张雪峰做了十年直播,核心就五六个判断模型,翻来覆去地用。现在这些模型结构化地写进了 Skill 文件,谁装上,谁就继承了这套判断逻辑。代码是死的,判断是活的。 志愿这件事,信息差就是命差。 张雪峰不在了,这套框架没走。
产品经理老王霸43,603 views • 3 months ago