知识猫AI实验室's banner
知识猫AI实验室's profile picture

知识猫AI实验室

@GeekCatX27,198 subscribers

10年+大厂程序员|AI内容工程师 用 AI 做图、做视频、搭工作流 分享真实作品、工具与增长实验 探索一人公司的更多可能 学习/咨询/合作👇 vx:gnipbao

Shorts

兄弟们最近这类AI地铁换装视频非常的火爆,随随便便大几十w的浏览。但在猫哥这里轻松复刻,用GPT 6 Astra加持优化后的反推skill,一次性直接出,用的还是MinMax H3 图生视频模式,效果也相当能打 。没办法猫哥穷鬼一个,用不起Seedance2.5。 详细提示词👇

兄弟们最近这类AI地铁换装视频非常的火爆,随随便便大几十w的浏览。但在猫哥这里轻松复刻,用GPT 6 Astra加持优化后的反推skill,一次性直接出,用的还是MinMax H3 图生视频模式,效果也相当能打 。没办法猫哥穷鬼一个,用不起Seedance2.5。 详细提示词👇

345,526 görüntüleme

兄弟们,大引擎暂时熄火,我先做了个能用的轻量版。 最近视频反推引擎因为 Token 消耗太大,展示功能暂时停了。没等它重置,我先做了一个 MiniMax H3 视频反推提示词模板。 给它一个参考视频,就能反推出 MiniMax H3 专用提示词,支持文生视频和图生视频,当然反推完可以基于官方H3-Prompt Writing再优化一波效果更好。 我拿一个最近流行的动画视觉做了测试,单次生成效果已经很能打。 猫社现在开放内测。 299 元,获得永久内测资格,不是买个文件就结束,后续可以获取猫哥最新低成本AI研究玩法。 想进来的,评论区留「H3」加我。 反推视频提示词太长我放评论区👇

兄弟们,大引擎暂时熄火,我先做了个能用的轻量版。 最近视频反推引擎因为 Token 消耗太大,展示功能暂时停了。没等它重置,我先做了一个 MiniMax H3 视频反推提示词模板。 给它一个参考视频,就能反推出 MiniMax H3 专用提示词,支持文生视频和图生视频,当然反推完可以基于官方H3-Prompt Writing再优化一波效果更好。 我拿一个最近流行的动画视觉做了测试,单次生成效果已经很能打。 猫社现在开放内测。 299 元,获得永久内测资格,不是买个文件就结束,后续可以获取猫哥最新低成本AI研究玩法。 想进来的,评论区留「H3」加我。 反推视频提示词太长我放评论区👇

579,912 görüntüleme

H3做这种治愈系慢生活视频感觉也不错呀 提示词评论区👇

H3做这种治愈系慢生活视频感觉也不错呀 提示词评论区👇

92,344 görüntüleme

前几天看到有老外分享,基于Blender做预演视频来准确生成各种复杂场景AI视频。 我用CozyClay号称网页版本 Blender 做了一个模拟五影会谈的预演建模视频。 建模我是用前几天Zcode 送的GLM 5.3 Flash做的。然后录制成视频,我全程不懂什么是Blender,我只是告诉GLM帮我做一个5人圆桌会谈模拟无影会谈的样子。 视频是基于MiniMax 全能参考我用的懒人工具runninghub,由于偷懒没有单独做5人的角色卡图做了一整整合的,然后提示词写的也比较简单,中间雷影这里人物说话没区分出来,但是基本上画面人物顺序是对上了,一次性出来的,然后视频参考这里非常耗时基本要1个小时了,20s基本会崩后期出来渲染问题,后面我换成了15s的好多了。 整理来看如果要直接出这种视频人物运镜角度都是非常难控的。 这种预演台的模式对于影视制作来说是非常好的一种方式。 相关资源:👇

前几天看到有老外分享,基于Blender做预演视频来准确生成各种复杂场景AI视频。 我用CozyClay号称网页版本 Blender 做了一个模拟五影会谈的预演建模视频。 建模我是用前几天Zcode 送的GLM 5.3 Flash做的。然后录制成视频,我全程不懂什么是Blender,我只是告诉GLM帮我做一个5人圆桌会谈模拟无影会谈的样子。 视频是基于MiniMax 全能参考我用的懒人工具runninghub,由于偷懒没有单独做5人的角色卡图做了一整整合的,然后提示词写的也比较简单,中间雷影这里人物说话没区分出来,但是基本上画面人物顺序是对上了,一次性出来的,然后视频参考这里非常耗时基本要1个小时了,20s基本会崩后期出来渲染问题,后面我换成了15s的好多了。 整理来看如果要直接出这种视频人物运镜角度都是非常难控的。 这种预演台的模式对于影视制作来说是非常好的一种方式。 相关资源:👇

14,495 görüntüleme

MiniMax H3做这种治愈短道滑板类视频也是非常的好,同样是复刻,这次采用的是图生视频模式,还原度太高了。 提示👇

MiniMax H3做这种治愈短道滑板类视频也是非常的好,同样是复刻,这次采用的是图生视频模式,还原度太高了。 提示👇

23,805 görüntüleme

我用视频反推提示词+Google omni 生成,效果也非常可以呀。omni真实干装修的一把好手。 提示词:👇

我用视频反推提示词+Google omni 生成,效果也非常可以呀。omni真实干装修的一把好手。 提示词:👇

21,561 görüntüleme

兄弟们,最近我扒了全网比较好用的电商提示词,做了一套「全平台通用电商视觉引擎工作流」。 目前已经在 SkildArt 跑通: 上传一张产品图,就能生成 12 张电商套图。 重点不是让 AI 随便出一张好看的商品图,而是把电商视 觉拆成可复用流程: 主视觉/产品中心图/卖点图/场景图/细节图/规格图/横版首屏图 每张图都有明确用途。 产品不能变形,Logo 不能乱跑,卖点不能瞎编,整组图风格要统一。 我实测下来,SkildArt 这类电商视觉工作台确实更适合做成套内容: 无限画布适合搭复杂生图流程; Agent 对话适合单张图灵活设计; 局部修改很方便; 视频模型也能和画布结合使用。 我还复刻了最近很火的「低能量穿搭换装」视频。 先在画布生成两组穿搭场景: 一组普通职业 Look, 一组明亮夏日多巴胺配色。 再切到视频模型,输入简单的转场和运镜描述,就能生成换装视频原素材。后面简单剪辑加 BGM 就能发。 以前这类内容要实拍两套造型,还要对镜头和节奏,现在工作流能直接把门槛拉低很多。 我觉得 AI 电商图真正的价值,不是单张图好看,而是稳定生成一整套能卖货的视觉资产。 完整工作流和低能量穿搭复刻提示词,可以去 SkildArt 广场搜关键词: 电商系统通用、夏日多巴胺换装 全部开源到里面了

兄弟们,最近我扒了全网比较好用的电商提示词,做了一套「全平台通用电商视觉引擎工作流」。 目前已经在 SkildArt 跑通: 上传一张产品图,就能生成 12 张电商套图。 重点不是让 AI 随便出一张好看的商品图,而是把电商视 觉拆成可复用流程: 主视觉/产品中心图/卖点图/场景图/细节图/规格图/横版首屏图 每张图都有明确用途。 产品不能变形,Logo 不能乱跑,卖点不能瞎编,整组图风格要统一。 我实测下来,SkildArt 这类电商视觉工作台确实更适合做成套内容: 无限画布适合搭复杂生图流程; Agent 对话适合单张图灵活设计; 局部修改很方便; 视频模型也能和画布结合使用。 我还复刻了最近很火的「低能量穿搭换装」视频。 先在画布生成两组穿搭场景: 一组普通职业 Look, 一组明亮夏日多巴胺配色。 再切到视频模型,输入简单的转场和运镜描述,就能生成换装视频原素材。后面简单剪辑加 BGM 就能发。 以前这类内容要实拍两套造型,还要对镜头和节奏,现在工作流能直接把门槛拉低很多。 我觉得 AI 电商图真正的价值,不是单张图好看,而是稳定生成一整套能卖货的视觉资产。 完整工作流和低能量穿搭复刻提示词,可以去 SkildArt 广场搜关键词: 电商系统通用、夏日多巴胺换装 全部开源到里面了

85,083 görüntüleme

兄弟们,前段时间抖音爆火的Q冰摇美女卡点换装视频工作流,我用SkildArt的无限画布复刻出来了,使用了Seedance2的全能参考,不建议普通用户去尝试,烧不起比较费积分,做电商的小伙伴可以学习下这个无限画布工作流搭建还是非常有价值的。 完整工作流提示词👇 灵感广场搜索:卡点换装舞蹈直接学习参考。 另外平台目前有个活动,SkildArt Starter 尝鲜包:活动价 9.9 元,包含 7 天会员权益和 150 积分,同时可体验高级模型,支持标准生成速度和 1 个并发任务,GG-香蕉2、OG-Image2 等精选模型支持无限免费生成,性价比还是挺高的。

兄弟们,前段时间抖音爆火的Q冰摇美女卡点换装视频工作流,我用SkildArt的无限画布复刻出来了,使用了Seedance2的全能参考,不建议普通用户去尝试,烧不起比较费积分,做电商的小伙伴可以学习下这个无限画布工作流搭建还是非常有价值的。 完整工作流提示词👇 灵感广场搜索:卡点换装舞蹈直接学习参考。 另外平台目前有个活动,SkildArt Starter 尝鲜包:活动价 9.9 元,包含 7 天会员权益和 150 积分,同时可体验高级模型,支持标准生成速度和 1 个并发任务,GG-香蕉2、OG-Image2 等精选模型支持无限免费生成,性价比还是挺高的。

24,762 görüntüleme

兄弟们,基于Codex做一个白板手绘视频生成skill,只要上传原始图片,即可生成类似的手绘视频,非常的丝滑,目前市面上大部分白板手绘视频的都是收费的,而且也不便宜,目前还在优化打磨中想要的兄弟,可以点赞转发,浏览破w我就开源出来

兄弟们,基于Codex做一个白板手绘视频生成skill,只要上传原始图片,即可生成类似的手绘视频,非常的丝滑,目前市面上大部分白板手绘视频的都是收费的,而且也不便宜,目前还在优化打磨中想要的兄弟,可以点赞转发,浏览破w我就开源出来

50,209 görüntüleme

兄弟们,小红书刷到一个绘画博主,发了好几条视频点赞收藏破万非常受欢迎,这种乱线稿视频感觉是AI出的啊?配上bgm非常的带劲,赶紧研究一波,感觉基于我之前的白板skill就能实现。

兄弟们,小红书刷到一个绘画博主,发了好几条视频点赞收藏破万非常受欢迎,这种乱线稿视频感觉是AI出的啊?配上bgm非常的带劲,赶紧研究一波,感觉基于我之前的白板skill就能实现。

22,842 görüntüleme

兄弟们,昨天看完 K3 的开源宣传片,我发现它的表达思路,和「道 Skill」的底层逻辑高度一致,所以我直接把「造 Skill 的方法」也开源了。 真正值得开源的,不只是一个成品,更是创造它的方法。 于是,我参考 K3 官方视频,也做了一支「道 Skill」宣传片。 这套 Skill 元方法论,我已经测试、优化、迭代了很多个版本。现在正式开源。 如果你也在做 Skill,不必每次都从零开始。拿去用,拿去改,也欢迎一起把它迭代得更强。

兄弟们,昨天看完 K3 的开源宣传片,我发现它的表达思路,和「道 Skill」的底层逻辑高度一致,所以我直接把「造 Skill 的方法」也开源了。 真正值得开源的,不只是一个成品,更是创造它的方法。 于是,我参考 K3 官方视频,也做了一支「道 Skill」宣传片。 这套 Skill 元方法论,我已经测试、优化、迭代了很多个版本。现在正式开源。 如果你也在做 Skill,不必每次都从零开始。拿去用,拿去改,也欢迎一起把它迭代得更强。

26,128 görüntüleme

兄弟们,MiniMax H3 模型,这套 全中文文字动效视频 是真的炫酷,可惜官方给的提示词不全,我尝试补全了下。 并用开源版本进行了尝试效果也是非常的好,只是部分细节还没有很到位感觉开源版本和实际应用之前还有些差距。 提示词放到评论了有点长👇

兄弟们,MiniMax H3 模型,这套 全中文文字动效视频 是真的炫酷,可惜官方给的提示词不全,我尝试补全了下。 并用开源版本进行了尝试效果也是非常的好,只是部分细节还没有很到位感觉开源版本和实际应用之前还有些差距。 提示词放到评论了有点长👇

21,292 görüntüleme

兄弟们,大家知道我最近在研究H3 视频模型,然后顺手做了套视频反推提示词助手以及文生视频工作流。 可以直接出30s高清视频,猫社的兄弟们用了直呼牛逼,反推可以让你蒸馏任意风格视频,然后做成通用skill。 下面这种是火柴人跑酷风格,也非常炫酷,做一些经典语录情感账号视觉效果都非常好。 后面准备做一下整合,把这些风格都做成独立的skill, 整理给猫社的兄弟们,让他们拿去创作、起号,想加入猫社的可以主页置顶了解。 目前整个社群250多人了,300人继续开启阶梯涨价。 火柴人文字跑通提示词见评论区👇

兄弟们,大家知道我最近在研究H3 视频模型,然后顺手做了套视频反推提示词助手以及文生视频工作流。 可以直接出30s高清视频,猫社的兄弟们用了直呼牛逼,反推可以让你蒸馏任意风格视频,然后做成通用skill。 下面这种是火柴人跑酷风格,也非常炫酷,做一些经典语录情感账号视觉效果都非常好。 后面准备做一下整合,把这些风格都做成独立的skill, 整理给猫社的兄弟们,让他们拿去创作、起号,想加入猫社的可以主页置顶了解。 目前整个社群250多人了,300人继续开启阶梯涨价。 火柴人文字跑通提示词见评论区👇

13,819 görüntüleme

兄弟们,MiniMax H3 模型官方手册上很多case提示词都是不全的,我找到了一种可以完美补全的方法。 直接用官方开源的skill 把它demo不全的提示丢给H3-Prompt-Writing 再加上其他你需要的场景描述,直接输出最终提示词,效果非常的好。

兄弟们,MiniMax H3 模型官方手册上很多case提示词都是不全的,我找到了一种可以完美补全的方法。 直接用官方开源的skill 把它demo不全的提示丢给H3-Prompt-Writing 再加上其他你需要的场景描述,直接输出最终提示词,效果非常的好。

17,543 görüntüleme

用了官方h3-prompt-writing skill补全旁白和提示词,效果非常好呀,感觉也能直接做漫剧了是不是?

用了官方h3-prompt-writing skill补全旁白和提示词,效果非常好呀,感觉也能直接做漫剧了是不是?

16,294 görüntüleme

做了个提线木偶,兄弟们看看这个效果如何,想体验可以看引用贴链接,网站和引擎都已经开源,一大波作品创意正在路上。

做了个提线木偶,兄弟们看看这个效果如何,想体验可以看引用贴链接,网站和引擎都已经开源,一大波作品创意正在路上。

13,239 görüntüleme

Videos

GeekCatX's profile picture

一张图,一段提示词。 我让 Apodex 做了一次「AI黄果短剧」逆向研究,最后拿到了一份10万字的拆解文档。 对这种能把复杂任务做完的 Agent 感兴趣,可以先给他们开源的 FrontierAgent 仓库 点个 ⭐ Star,支持一下,也方便后续自己上手。 完整操作我录下来了。 前半段看怎么做,后半段直接打开文档,看这10万字到底拆了什么。 先说操作。 在 Apodex 网页端上传之前流出的黄果制作流程图,再把研究目标和交付要求写清楚。 这里有个关键:需要一段提示词帮你把Apodex能力拉到极限。 一张图是研究入口,不是全部证据。 Apodex 可以在同一个任务里处理文件、检索资料、执行代码,并通过任务看板展示进展。过程中也能追加要求,保留仍然有效的成果,再调整受影响的部分。官方介绍 不过,真正值得展开的,是后面这份文档。 我会重点翻四块内容。 第一,视觉拆解。 角色外形、配色、构图、光影、材质……把一句“这个画风很特别”,拆成具体能描述、能比较的要素。 第二,制作流程。 从角色设定、分镜,到图像与视频生成,再到配音、剪辑。重点看每一步需要什么输入、产出什么,以及前后怎样接起来。 第三,提示词与示例。 不是只收藏一段很长的提示词,而是看懂角色、动作、场景、镜头和风格分别承担什么作用。换一个人物或故事时,才知道哪里该改、哪里要保持一致。 第四,问题与验证。 哪些判断有来源?哪些只是合理推测?角色一致性、镜头衔接这些问题,后面还需要怎么测试? 尤其是一张图无法证明原作者用了哪个模型、哪段提示词。 逆向研究的价值,是找到有依据的制作路径,而不是把猜测写成答案。 所以,我想展示的并不只是“AI能写10万字”。 而是一个模糊的起点,能不能被推进成一份有结构、有依据、可以逐项检查的交付物。 能回答一个问题,和把一件事做完,是两回事。 这次我把输入、操作和最终文档放在一起。 你可以直接看:这10万字,到底有没有把问题讲明白。 想体验可以从 Apodex 网页端开始。 想放到自己的环境里运行,也可以看官方开放的 Mini 模型权重和 FrontierAgent 框架。 Apodex 网页端: API Platform: 开源框架 FrontierAgent: Apodex 1.1 mini 模型权重: #Apodex

知识猫AI实验室

42,408 görüntüleme • 7 gün önce

GeekCatX's profile picture

兄弟们,上周预告的“故事转手绘视频”Skill,今天正式开源了。 给它一段中文故事,它就能自动变成一支会从黑白慢慢长出颜色的手绘日记动画。 你可以直接输入中文故事文案,也可以上传一组按顺序排列的本地图片。 剩下的事情,它会自动完成: 把故事拆成分镜; 保留原文措辞和叙事节奏; 为每个画面配上手写体字幕; 让画面从黑白线稿逐渐上色; 最后输出方便继续配音和剪辑的静音MP4。 为了避免自动分镜把故事切得太碎,我专门调整了拆分逻辑。 默认一个完整句子对应一个节拍,只有遇到自然的动作或叙事转折,才会拆开较长的复合句。 如果你已经准备好了漫画页或手绘图片,也可以直接上传。 它会自动识别并拆分页面中的手写文字和插画,在本地生成与彩色插画对齐的黑白底稿,再制作成动画。 目前支持两种转场: 第一种是直接切换。 按照“文字→黑白线稿→彩色插画”的顺序,从左向右逐渐揭示。 第二种是翻页转场。 保留原始页面,从右下角卷起翻页,做出真正的手绘日记翻书感。 我还专门处理了一个很容易翻车的问题: 画面裁切。 所有插画都会被限制在白色安全边框内,只使用完整收纳的构图方式,不会为了铺满屏幕,把人物、文字或关键细节直接裁掉。 最终输出3:4竖屏静音画面轨: 正式版1080×1440; 预览版720×960。 很适合拿来制作童年回忆、人物故事、成长经历、情感叙事,以及其他需要温度感的中文故事视频。 底层使用Image2生成分镜,再通过Remotion完成动画与渲染。 项目已经完整开源: 觉得有用,可以顺手点个Star。 如果你在使用中发现问题,或者做出了新的动画效果,也欢迎提Issue、交PR,一起把它继续完善。

知识猫AI实验室

126,292 görüntüleme • 1 ay önce

GeekCatX's profile picture

视频生成模型的下一站,可能不是更长、更清晰的片子。 而是一个你能走进去,并亲手改变的世界。 过去两年,AI 视频已经能生成足够惊艳的画面。但无论视频多逼真,观众依然只能按下播放键: 镜头往哪里走,早已决定; 街角后面有什么,你无法靠近; 画面里出现什么,你也不能临时改变。 生成结束的那一刻,所有可能性也结束了。 Alaya Lab 刚刚开源的 AlayaWorld,试图把这件事反过来。 它不是先生成一段完整视频,再让你观看。 你可以用一张图片开启世界,推动摇杆改变镜头和移动方向;画面会随着操作继续生成。探索途中还能切换提示词,召唤火焰、凤凰、巨兽,或者让新的事件直接发生在当前场景里。 这意味着,AI 生成的内容第一次不只是“成片”,而开始接近一个可以进入、探索和影响的环境。 目前公开的几个核心指标: • 15B 参数 • 720p 分辨率 • 24 FPS 实时生成 • 支持 60 秒以上的连续探索 • 支持实时镜头控制与提示词切换 但真正困难的还不只是生成速度。 视频模型一旦连续运行,误差会逐帧累积:向前走了一段,再回头看,刚才的建筑可能已经变形;人物、道路和空间关系也会慢慢漂移。 这也是“生成视频”和“生成世界”的分水岭。 视频只要下一帧看起来合理。 世界却必须记得:东西在哪里、刚才发生过什么,以及你离开后再回来时,它是否还是原来的样子。 AlayaWorld 为此加入了两种互补的记忆: 一个显式 3D cache,用来保存空间位置; 一个压缩的帧历史,用来维持时间连续性。 再配合针对漂移历史的训练和 Error Bank,尽量阻止误差在长时间生成中不断放大。 所以这项工作的重点,不是“又一个画质更好的视频模型”。 而是把交互、空间记忆、长时稳定和实时生成,塞进同一个可以运行的系统里。 它现在当然还不是一款普通玩家打开电脑就能玩的游戏,也不能直接替代成熟的游戏引擎。 但它展示了一种很值得关注的方向: 未来的虚拟世界,未必需要把每栋建筑、每条道路和每个事件提前制作完成。 一部分世界,可能会在玩家移动和行动的同时,被模型实时生成出来。 这会影响的不只是游戏。 AI 原生玩法原型、影视预演、虚拟勘景、动态故事板,甚至机器人与智能体的训练环境,都可能从这种“可交互的生成世界”中长出来。 更难得的是,AlayaWorld 不只发布了 Demo。 模型权重与推理代码已经开放。你可以直接查看它如何处理实时交互、空间记忆和长时间生成,也可以下载权重进行研究与复现。 如果你正在关注世界模型、AI 游戏或交互式生成,这个项目值得拆一遍: Alaya Lab

知识猫AI实验室

70,424 görüntüleme • 2 ay önce

GeekCatX's profile picture

兄弟们,Vox Style Skill又更新了。 这次新增了一套更适合自媒体内容的美漫模板。 之前的模板主要走新中式路线,比较适合中国古典文化、历史故事和东方美学类内容。 这次的美漫模板,颜色更加艳丽,视觉冲击力更强,能够适配的内容场景也更多。 知识科普、人物故事、商业观点、热点解读,都可以拿来尝试。 最关键的是成本。 按照我目前跑通的低成本工作流,制作一条Vox风格视频,理论生成成本低至1毛钱左右。 即使把废片和返工算进去,保守成本也不到2毛钱一条。 当然,这里没有计算人工时间,也没有把本来就在使用的Codex订阅摊进去。 但对于想做自媒体、预算又不高的人来说,这个成本已经足够低了。 如果你一直想做自媒体,却卡在: 没时间研究复杂工具; 请不起设计师和剪辑师; 不想每个月投入一大笔软件费用; 这套基于Codex的内容工作流,应该会比较适合你。 最近猫哥也一直在做一件事: 不断挖掘、测试和打磨低成本的创意视频制作方法。 目前已经有不少工具和工作流进入开发、测试阶段,大部分基于Codex就能直接使用。 猫社聚焦的方向很明确: AI+内容创作。 包括AI绘图、AI视频、AI工具实战,以及能真正用于自媒体生产的低成本工作流。 我们不追求收藏一堆看起来很厉害的工具。 而是希望把这些工具组合起来,让一个人也能持续产出内容。 每测试一次,就沉淀一套方法; 每完成一个作品,就积累一份内容资产; 再通过自媒体,持续放大自己的能力、作品和影响力。 低成本只是起点。 真正有价值的是,一个人借助Codex,也能跑通从创意、画面到视频制作的完整流程。 这次新增的美漫模板,也会同步给猫社群友使用。 目前猫社距离200人还剩9个位置。 满200人后,入群价格将调整至299元。 如果你本来就想做AI内容、自媒体或者低成本创意视频,可以趁当前价格加入。 想进群的,直接私信我回复:猫社。

知识猫AI实验室

28,113 görüntüleme • 1 ay önce