正在加载视频...

视频加载失败

基于 神奇小喷菇AIGC 的思路和解析,实验基本成功。 主要思路包括以下几点: 1. 基础素材的准备,也就是首尾帧。就像最终呈现的结果,首帧是一个脏乱差的图片,尾帧是一个最终的装修结果图。基于这个思路,就比较好办了。 如果你有一张比较不错的图(比如你直接把你家的客厅、卧室拍下来,或者之前去网上找精致的装修图)。让AI帮你完成做旧。 提示词如下: “基于底图,生成一张年久失修,脏乱的室内场景,有很多老旧的家具与肮脏的使用痕迹” 根据需求决定是否要移除家具,如果需要,增加这个提示词: “移除家具,保留脏乱的毛坯房的效果,但是要注意保持结构的一致性” 这样我们就能获得一张脏乱差的原始底图了。 至于尾帧,我们可以直接用比较好的成果图,如果你觉得你现有的这种照片不够好看,可以让AI帮你进行润色和修改。 提示词参考: “保持原图视角和墙体结构,生成室内{客厅} 真实渲染图。进行合理的室内家具布置与材质搭配,为室内天花板、墙面、地板分别赋予材质,整体呈现 {现代轻奢风格} 。房间内外均进行真实感渲染。包括 {沙发, 地毯 ,茶几} ,材质质感逼真,光线自然。整体画面呈现出专业建筑摄影的光线效果,具备4K超高清分辨率的图像细节。” 拿到首尾帧之后就可以进行视频生成了,在测试了即梦、可灵、Veo之后。目前最稳定的就是可灵2.6(O1在这个场景下表现一般,不推荐) 视频提示词如下: 房间装修延时摄影视频。工人们在一间简陋的毛坯房内工作,水泥墙面,。快进画面展示:人们清理杂物和垃圾袋、移除所有旧家具,{将房屋还原至毛坯房,擦洗墙壁、将灰色水泥墙刷成现代轻奢风格、先完成主体框架装修,再放入家具,再逐渐将一个房屋搭建成最终的现代轻奢风格的客厅}。多名工人在加速画面中快速移动,工具和材料不断出现又消失,窗外自然光线随时间变化。施工灰尘逐渐落定,从冷蓝色调转变为温暖的环境光。纪实风格,8-16倍速延时,4K画质。 中间的步骤可以再详细点,我这个比较泛用性。这个版本还是可以再次进行迭代的

86,292 次观看 • 8 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 次观看 • 2 年前

抖音起号做出爆款诀窍:首帧生成 I2V。 如果你的目标是做出爆款AIGC短视频起号,而不是出长期稳定的动画剧集,那么我更推荐使用视频生成模型的首帧生成模式,该模式对于seedance系列与minimax-h3都是适用的。 一开始我在抖音上调研时,发现了一个爆款的 AIGC 博主。他的视频风格非常华丽,角色动作干脆利落,特效炫酷。而且他非常慷慨,把提示词都分享了出来(是真的自用提示词,甚至连他的本地缓存图片路径都露出来了) 结果我看他的提示词,虽然动作很华丽,但编排其实特别简单,与我们想象中长篇大论的那种“导演视角”做出来的效果完全不一样。 他分享的真正诀窍在于:使用视频模型首帧生成。只要规定好首帧的场景、人物等约束,并通过首帧画面定住风格,后续画面就会非常统一,哪怕只用简单的提示词,都能做出非常震撼的效果。 最后从技术层面解释一下,为什么首帧生成比上传参考图,设定图更具有优势。 Seedance 官方有写说明文档:若要严格保证开场画面和指定图片一致,优先走真正的图生视频首帧。 官方论文提到,I2V 主流做法是把给定图像当作时间轴上的第 0 帧: 图像 latent 与噪声拼接、首帧特征进时空注意力、甚至用图像噪声先验做残差预测。 后续帧是在「已经钉死的像素布局」上长出来的运动。 参考图常见路径更偏语义嵌入或特征引导,能够保证「像不像这个人 / 这种风」,不保证第 1 帧构图、光影、材质、镜头焦段和你上传的那张图像素级对齐。 不过首帧参考图的生成也是有很多门道,这点是被很多人忽略,也是那些爆款视频不说的秘诀(是的,那位抖音博主分享了所有提示词,唯独没有分享首帧怎么生成的,属于是真正的技术壁垒) 我自己深入扒了两天,把里面的门道也探索了个七七八八,下期给大家分享我自己实操总结的首帧生成技巧。 最后依然是展示视频效果,搭配bgm食用更佳

雪踏乌云

39,840 次观看 • 1 个月前

不花一分钱快,速用Seedance2.0生成真人质感的假面全网爆火的打斗短视频呢? 就是已经被说烂随便app和豆包,具体怎么操作,我先分享这个提示词再我写个文吧,这些app每天10次的抽卡加上豆包10个积分机会其实足够生成一个小片段用的,只要你的提示词写得好,抽卡几率也大大降低! 另外再分享一个小云雀上都有的、但是热度一直很高的提示词,作为一名合格的搬运工!! 我必须要说的是,这些其实都可以找豆包写的,完全不用问东问西,更不用付费!!!!(因为我抠搜,我至今没花过一毛钱在ai软件,gemini的其实也算是白嫖的) 最近因为敏感词和IP等不再提供假面、铠甲变身的素材,导致很多提示词不能用?那不是因为词的问题,问题在你的图,不要去垫图,用自己画的假面或者机甲,下面你只需要准备三样素材(正派、反派、背景(根据需求,也可以文字描述): 1️⃣主角:@你的数字人/@图1的cos真人版(不要用IP) 2️⃣主角变身后:@图2(一定得用真实的照片,最好用mj/grok艺术化以后,用🍌转成真实风格(一定是写实的)保证成片! 3️⃣反派:@图3/你用文字描述的即可(各大app一大堆) 4️⃣场景:@图4(如果你需要固定场景的长篇幅确保一致性,必须要垫的图) 这样只用写动作和特效即可!(提示词我放在评论区了)👇👇👇 基本能保证你的账号日更基本不成问题!👇

𝟡𝟜 ᴾᴸᴬʸᶠᴼᴿᴳᴱ

52,764 次观看 • 7 个月前

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

17,728 次观看 • 2 个月前

除了提示词,其实输入画面对视频质量影响也非常大,下面就是我在把第一版的图片通过提示词改进后的第二版图片的基础上生成的相同提示词下生成的画面效果,画面的质感有很大的变化,第一排是原始MJ生图与seedance 2 视频,第二排是,通过提示词在nano banana pro 上重新真实化后的图与视频。图片转换的提示词:👇👇👇👇核心要求: 将参考图中的所有元素——包括角色、场景、道具、环境——全部转化为超写实真人实景,如同实地拍摄的电影剧照。 角色转化: 严格保留原角色的发型、服装、表情、五官特征、肢体动作与整体气质,转换为真实演员形象。 场景转化: • 将漫画/插画场景还原为真实可拍摄的物理空间 • 所有道具、家具、建筑必须是实物搭景或实景取景 • 材质质感真实:布料褶皱、木纹肌理、金属反光、墙面纹理 • 环境细节丰富:灰尘、磨损痕迹、生活化细节 • 空间透视与光影符合物理规律 摄影风格:电影级实景摄影 • 深景深构图,前景到背景全部清晰 • 胶片质感,柔和颗粒与丰富色彩层次 • 戏剧化光影对比:暖色钨丝工作灯 vs 冷色自然暮光 • 主体突出,同时保留环境叙事性 • 如同《银翼杀手》《布达佩斯大饭店》级别的场景美术与摄影 技术规格: • 胶片:Kodak Vision3 500T(电影摄影标准) • 适用场景:夜景、低光环境、室内钨丝灯照明 • 光圈:f/8–f/11(深景深,全画面清晰) • 焦段:35mm–50mm(标准电影视角) • 分辨率:4K cinema 或更高 • 色彩:温暖饱和的钨丝灯色温,暗部细节保留 • 灯光设计:三点布光或自然光结合,营造电影级光影层次 场景美术要求: • 实景搭建或外景取景,杜绝CG合成感 • 道具陈设符合角色背景与时代设定 • 空间设计有纵深感与生活气息 • 墙面、地板、天花板等环境元素具有真实质感 • 背景人物(如有)也需真实演员,避免模糊处理 反向提示词(严格避免): • 模糊背景、浅景深、散景、失焦 • 卡通、动漫、插画风、手绘质感、CG渲染感 • 平面化构图、缺乏空间纵深 • 假布景、绿幕合成痕迹、数字背景 • 面部变形、比例失调、AI生成痕迹 • 低质量、数字噪点、像素化、过度锐化 • 过曝强光、塑料质感、过度数字后期 • 道具悬浮、物理不合理、材质贴图感 • 空洞背景、缺乏细节、环境单调 参考风格: 电影摄影大师级作品 - Roger Deakins、Emmanuel Lubezki、Hoyte van Hoytema 的实景拍摄美学。

John

17,690 次观看 • 7 个月前

大半夜体验完 Manus AI, 达到了今天的使用限制,说一下自己的感受🧵 整体来讲,真的很强大, 主要体现在 Manus 能够: 🔧展示完整的推理逻辑,有个 Manus 电脑的东西为你呈现所有过程和进展; 🏗️调用各种API 协同完成任务; 📃最终非常实际的交付给你一个可用的文件。 🌟「真正能干活」的AI Agent,这个定位真的太准确了。 以下是一些实例: 1️⃣基础任务完成度高 比如最近日本可以看樱花了,整理一个具体的旅行清单包括日程、推荐景点、住宿、交通等等; 家里领导喜欢看红楼梦,梳理一下红楼梦的人物关系。 以下是分别让他做的一个 pdf 文档和可以互动的网页,完成度是真的很高,不过人物关系上有一点小错误,无伤大雅。 其他比如让他阅读视频给到总结,甚至让他剪辑播客都是可以的(只是效果不太好)。 但是我尝试让他给我画一些图🗺️,这方面还有所欠缺,给到的理由是第三方 API 接口出错。同时网上说她可以做ppt,确实是可以的,但是能做ppt的工具都存在一个共同问题,逻辑还行,但就是丑。所以“美术”相关工作我理解还是做不了的。 另外,他是一个完成特定任务的助手,不要把它当作聊天机器人,不然他每次跟你聊天都要思考十几分钟,真的很难受。 2️⃣测一测他懂不懂Web3 给了两个任务: a) 我们今天发了一个depin的研报,花了一个多月,自认为还行,让他给这个研报评分,并且给到其他更好的文章推荐。 我们的depin报告如下 他给到的内容如图3,更详细的评价文档我传了一个Google 链接,放在最后了,各位可以自行查看(包括前面的红楼梦人物关系图)。 整体来看,他快速学习和阅读了大量 web3 depin 的报告,并且从多个维度给出了我们报告的评价,以及推荐的其他报告和对应的评价。 b) 假设我是一个 交易所cmo,如何做华语市场的传播策略,包括华语媒体和华语kol的整理和评级。很遗憾,我已经等了一个多小时他还没思考完,如果明天有结果,我也会传到Google link里。(Manus 可以离线、多任务思考,所以可以同时开启多个任务,或者关机后之前的任务仍然会运行) 不过我看到了他的实时分析过程,在阅读各个媒体、kol 的官网文章,历史推文等等,形成自己的分析。见图4 所以我理解在他的大脑里是有 web3 内容,并可以实时学习的。 3️⃣除了懂,他能否与 Web3 交互 以上的推理其实都和 Web3 没有实际关系,我更关心他能否拿到链上数据,甚至能够交互。比如是否知道 $SOL $ETH 能在哪些地方质押,收益如何等等,还有一些深入的分析问题。 很遗憾,今天的使用次数达到限制了。明天再说吧👋 -------------------------------------------- 等待 Manus 思考结果的时候,我也看了一些其他的博主评价和官方的介绍,我觉得有一点说的很好: “没有开源,就没有 Manus AI” 从一个体验过多个AI产品的小白角度,我其实觉得 Manus 会这么火爆的原因主要在于:调用了多种 API 接口,配合自己的推理算法最终呈现了一个很好的产品。 这让我想到 ai16zdao 每周都有新的人贡献 plugin(比如 微信,deepseek),让这个网络不断壮大; Virtuals Protocol 通过打通 agent 得底层框架,形成 agent 经济体;还有 Hey Anon 不只是有链上数据,还能直接帮你交互等等。 某一天,web2 和 web3 的 AI 产品肯定会更加紧密的相互协作,并出来几个不错的case。 最近有一些 betting 的产品已经初现端倪。 Manus 也会开源自己的能力,为了更大的 AGI 世界。 如果真到了那一天,我就真的要失业了🥲 ( Google drive 素材链接:

Zolo 🌊

40,430 次观看 • 1 年前