Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

基于 神奇小喷菇AIGC 的思路和解析,实验基本成功。 主要思路包括以下几点: 1. 基础素材的准备,也就是首尾帧。就像最终呈现的结果,首帧是一个脏乱差的图片,尾帧是一个最终的装修结果图。基于这个思路,就比较好办了。 如果你有一张比较不错的图(比如你直接把你家的客厅、卧室拍下来,或者之前去网上找精致的装修图)。让AI帮你完成做旧。 提示词如下: “基于底图,生成一张年久失修,脏乱的室内场景,有很多老旧的家具与肮脏的使用痕迹” 根据需求决定是否要移除家具,如果需要,增加这个提示词: “移除家具,保留脏乱的毛坯房的效果,但是要注意保持结构的一致性” 这样我们就能获得一张脏乱差的原始底图了。 至于尾帧,我们可以直接用比较好的成果图,如果你觉得你现有的这种照片不够好看,可以让AI帮你进行润色和修改。 提示词参考: “保持原图视角和墙体结构,生成室内{客厅} 真实渲染图。进行合理的室内家具布置与材质搭配,为室内天花板、墙面、地板分别赋予材质,整体呈现 {现代轻奢风格} 。房间内外均进行真实感渲染。包括 {沙发, 地毯 ,茶几} ,材质质感逼真,光线自然。整体画面呈现出专业建筑摄影的光线效果,具备4K超高清分辨率的图像细节。” 拿到首尾帧之后就可以进行视频生成了,在测试了即梦、可灵、Veo之后。目前最稳定的就是可灵2.6(O1在这个场景下表现一般,不推荐) 视频提示词如下: 房间装修延时摄影视频。工人们在一间简陋的毛坯房内工作,水泥墙面,。快进画面展示:人们清理杂物和垃圾袋、移除所有旧家具,{将房屋还原至毛坯房,擦洗墙壁、将灰色水泥墙刷成现代轻奢风格、先完成主体框架装修,再放入家具,再逐渐将一个房屋搭建成最终的现代轻奢风格的客厅}。多名工人在加速画面中快速移动,工具和材料不断出现又消失,窗外自然光线随时间变化。施工灰尘逐渐落定,从冷蓝色调转变为温暖的环境光。纪实风格,8-16倍速延时,4K画质。 中间的步骤可以再详细点,我这个比较泛用性。这个版本还是可以再次进行迭代的

86,292 görüntüleme • 7 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 görüntüleme • 2 yıl önce

不花一分钱快,速用Seedance2.0生成真人质感的假面全网爆火的打斗短视频呢? 就是已经被说烂随便app和豆包,具体怎么操作,我先分享这个提示词再我写个文吧,这些app每天10次的抽卡加上豆包10个积分机会其实足够生成一个小片段用的,只要你的提示词写得好,抽卡几率也大大降低! 另外再分享一个小云雀上都有的、但是热度一直很高的提示词,作为一名合格的搬运工!! 我必须要说的是,这些其实都可以找豆包写的,完全不用问东问西,更不用付费!!!!(因为我抠搜,我至今没花过一毛钱在ai软件,gemini的其实也算是白嫖的) 最近因为敏感词和IP等不再提供假面、铠甲变身的素材,导致很多提示词不能用?那不是因为词的问题,问题在你的图,不要去垫图,用自己画的假面或者机甲,下面你只需要准备三样素材(正派、反派、背景(根据需求,也可以文字描述): 1️⃣主角:@你的数字人/@图1的cos真人版(不要用IP) 2️⃣主角变身后:@图2(一定得用真实的照片,最好用mj/grok艺术化以后,用🍌转成真实风格(一定是写实的)保证成片! 3️⃣反派:@图3/你用文字描述的即可(各大app一大堆) 4️⃣场景:@图4(如果你需要固定场景的长篇幅确保一致性,必须要垫的图) 这样只用写动作和特效即可!(提示词我放在评论区了)👇👇👇 基本能保证你的账号日更基本不成问题!👇

𝟡𝟜 ᴾᴸᴬʸᶠᴼᴿᴳᴱ

51,181 görüntüleme • 5 ay önce

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

17,728 görüntüleme • 1 ay önce

今天用 MiniMax H3 做了一些视频,简单说说感受。做视频的时候,做毁了好几个。不明白为什么,后来才意识到可能是提示词写的太复杂了。我做视频时候总是把提示词写的非常细,这样大大减少了我的抽卡次数,但是这种做法适用于即梦,却未必适用于MiniMax H3。 MiniMax H3画面质感和光影是非常出色的,它的运镜转场方面表现很好,但有时会过度。再说一下提示词,每个模型都有自己的特点,MiniMax H3是需要给它释放一点空间的。我写了太多的提示词,后来做出来的都怪怪的🙃。以下是我经过体验总结的优缺点👇,大家可供参考。 优点: 画面质感确实不错,尤其是光影、氛围和镜头运动,比较容易做出电影感。推拉、跟拍、环绕这类运镜,只要提示词和参考素材合适,效果通常不会太差。 它对图片、视频和音频的综合参考也比较实用。人物形象、场景风格和动作节奏可以一起控制,做广告短片、概念片或者氛围向内容会比较顺手。 生成效率也高。几秒到十几秒的镜头,挑一挑基本就能进剪辑,不一定需要大幅返工。 缺点 复杂动作还是容易出问题。人物一多,或者涉及跑动、打斗、交互,肢体、物体关系和前后细节就可能不稳定。 连续叙事也不是它的强项。单个镜头可以很好看,但多个镜头放在一起,人物状态、空间位置和情节衔接不一定能保持一致。 提示词写得太复杂,效果反而容易跑偏。很多时候不是描述得越细越好,而是要先抓住主体、动作和镜头,再一点点补限制。 整体来看,H3 很适合做高质量短镜头,画面和运镜是它比较明显的优势。但想做完整短片,还是需要分镜、反复生成和后期剪辑,不能完全指望一次成片。

九尾狐-FoxFairy🦊

34,352 görüntüleme • 13 gün önce

大半夜体验完 Manus AI, 达到了今天的使用限制,说一下自己的感受🧵 整体来讲,真的很强大, 主要体现在 Manus 能够: 🔧展示完整的推理逻辑,有个 Manus 电脑的东西为你呈现所有过程和进展; 🏗️调用各种API 协同完成任务; 📃最终非常实际的交付给你一个可用的文件。 🌟「真正能干活」的AI Agent,这个定位真的太准确了。 以下是一些实例: 1️⃣基础任务完成度高 比如最近日本可以看樱花了,整理一个具体的旅行清单包括日程、推荐景点、住宿、交通等等; 家里领导喜欢看红楼梦,梳理一下红楼梦的人物关系。 以下是分别让他做的一个 pdf 文档和可以互动的网页,完成度是真的很高,不过人物关系上有一点小错误,无伤大雅。 其他比如让他阅读视频给到总结,甚至让他剪辑播客都是可以的(只是效果不太好)。 但是我尝试让他给我画一些图🗺️,这方面还有所欠缺,给到的理由是第三方 API 接口出错。同时网上说她可以做ppt,确实是可以的,但是能做ppt的工具都存在一个共同问题,逻辑还行,但就是丑。所以“美术”相关工作我理解还是做不了的。 另外,他是一个完成特定任务的助手,不要把它当作聊天机器人,不然他每次跟你聊天都要思考十几分钟,真的很难受。 2️⃣测一测他懂不懂Web3 给了两个任务: a) 我们今天发了一个depin的研报,花了一个多月,自认为还行,让他给这个研报评分,并且给到其他更好的文章推荐。 我们的depin报告如下 他给到的内容如图3,更详细的评价文档我传了一个Google 链接,放在最后了,各位可以自行查看(包括前面的红楼梦人物关系图)。 整体来看,他快速学习和阅读了大量 web3 depin 的报告,并且从多个维度给出了我们报告的评价,以及推荐的其他报告和对应的评价。 b) 假设我是一个 交易所cmo,如何做华语市场的传播策略,包括华语媒体和华语kol的整理和评级。很遗憾,我已经等了一个多小时他还没思考完,如果明天有结果,我也会传到Google link里。(Manus 可以离线、多任务思考,所以可以同时开启多个任务,或者关机后之前的任务仍然会运行) 不过我看到了他的实时分析过程,在阅读各个媒体、kol 的官网文章,历史推文等等,形成自己的分析。见图4 所以我理解在他的大脑里是有 web3 内容,并可以实时学习的。 3️⃣除了懂,他能否与 Web3 交互 以上的推理其实都和 Web3 没有实际关系,我更关心他能否拿到链上数据,甚至能够交互。比如是否知道 $SOL $ETH 能在哪些地方质押,收益如何等等,还有一些深入的分析问题。 很遗憾,今天的使用次数达到限制了。明天再说吧👋 -------------------------------------------- 等待 Manus 思考结果的时候,我也看了一些其他的博主评价和官方的介绍,我觉得有一点说的很好: “没有开源,就没有 Manus AI” 从一个体验过多个AI产品的小白角度,我其实觉得 Manus 会这么火爆的原因主要在于:调用了多种 API 接口,配合自己的推理算法最终呈现了一个很好的产品。 这让我想到 ai16zdao 每周都有新的人贡献 plugin(比如 微信,deepseek),让这个网络不断壮大; Virtuals Protocol 通过打通 agent 得底层框架,形成 agent 经济体;还有 Hey Anon 不只是有链上数据,还能直接帮你交互等等。 某一天,web2 和 web3 的 AI 产品肯定会更加紧密的相互协作,并出来几个不错的case。 最近有一些 betting 的产品已经初现端倪。 Manus 也会开源自己的能力,为了更大的 AGI 世界。 如果真到了那一天,我就真的要失业了🥲 ( Google drive 素材链接:

Zolo 🌊

40,414 görüntüleme • 1 yıl önce

除了提示词,其实输入画面对视频质量影响也非常大,下面就是我在把第一版的图片通过提示词改进后的第二版图片的基础上生成的相同提示词下生成的画面效果,画面的质感有很大的变化,第一排是原始MJ生图与seedance 2 视频,第二排是,通过提示词在nano banana pro 上重新真实化后的图与视频。图片转换的提示词:👇👇👇👇核心要求: 将参考图中的所有元素——包括角色、场景、道具、环境——全部转化为超写实真人实景,如同实地拍摄的电影剧照。 角色转化: 严格保留原角色的发型、服装、表情、五官特征、肢体动作与整体气质,转换为真实演员形象。 场景转化: • 将漫画/插画场景还原为真实可拍摄的物理空间 • 所有道具、家具、建筑必须是实物搭景或实景取景 • 材质质感真实:布料褶皱、木纹肌理、金属反光、墙面纹理 • 环境细节丰富:灰尘、磨损痕迹、生活化细节 • 空间透视与光影符合物理规律 摄影风格:电影级实景摄影 • 深景深构图,前景到背景全部清晰 • 胶片质感,柔和颗粒与丰富色彩层次 • 戏剧化光影对比:暖色钨丝工作灯 vs 冷色自然暮光 • 主体突出,同时保留环境叙事性 • 如同《银翼杀手》《布达佩斯大饭店》级别的场景美术与摄影 技术规格: • 胶片:Kodak Vision3 500T(电影摄影标准) • 适用场景:夜景、低光环境、室内钨丝灯照明 • 光圈:f/8–f/11(深景深,全画面清晰) • 焦段:35mm–50mm(标准电影视角) • 分辨率:4K cinema 或更高 • 色彩:温暖饱和的钨丝灯色温,暗部细节保留 • 灯光设计:三点布光或自然光结合,营造电影级光影层次 场景美术要求: • 实景搭建或外景取景,杜绝CG合成感 • 道具陈设符合角色背景与时代设定 • 空间设计有纵深感与生活气息 • 墙面、地板、天花板等环境元素具有真实质感 • 背景人物(如有)也需真实演员,避免模糊处理 反向提示词(严格避免): • 模糊背景、浅景深、散景、失焦 • 卡通、动漫、插画风、手绘质感、CG渲染感 • 平面化构图、缺乏空间纵深 • 假布景、绿幕合成痕迹、数字背景 • 面部变形、比例失调、AI生成痕迹 • 低质量、数字噪点、像素化、过度锐化 • 过曝强光、塑料质感、过度数字后期 • 道具悬浮、物理不合理、材质贴图感 • 空洞背景、缺乏细节、环境单调 参考风格: 电影摄影大师级作品 - Roger Deakins、Emmanuel Lubezki、Hoyte van Hoytema 的实景拍摄美学。

John

17,310 görüntüleme • 5 ay önce

Anthropic推出了一项新功能,叫做“提示词改器”(Prompt Console)。 Claude 会使用思路链推理等提示工程技术自动对提示词进行改进,优化你的提示词,让AI的回答更准确、符合预期。 这项功能的主要作用: 1. 自动优化提示词:通过提示词改进工具,开发者可以让Claude模型自动优化现有的提示词(即向AI模型提出的问题或要求),以提高模型回答的质量。例如,工具会增加一个“链式思维”环节,让Claude在回答之前先有条理地思考问题,确保回答更精准。 2. 标准化和丰富示例:工具可以把提示中的示例转成统一的格式,比如XML格式,这样Claude更容易理解和处理。 3.示例增强:对现有示例进行自动补充,使其与结构化后的提示更加契合,包括增加链式思维的逻辑过程。 4.重写:对提示进行重写,明确其结构,并纠正小的语法或拼写错误,以提高提示的质量和易读性。 5.预填充:在Claude的助理消息中预填充内容,帮助引导Claude的行为,并确保输出格式符合需求。 一旦新提示生成,你还可以向Claude提供反馈,说明什么有效,什么不起作用,以进一步改进提示。 实际效果:根据Anthropic的测试数据,使用提示词改进工具后,模型的准确率在多标签分类任务中提升了30%,并且在摘要任务中能够100%完全遵循字数要求。

小互

39,813 görüntüleme • 1 yıl önce

玩币的过年坐小孩那桌! 截止目前,上证连着第18个阳,反观加密近30天的恐惧指数有28天低于40。 有这样一种感觉:你打开一个新的应用,点了几下,突然发现——“嘿,这比我想象中顺手多了!” 真正让人愿意重复进入一个产品的,并不是一堆炫酷的功能,而是细节上的 “无感优化”、行为路径上的 连贯性提升。这些项目正在悄悄做的,正是这种让体验变得自然的改进。 Spaace 🟠 — NFT 不只是市场,而是用户体验的“积木场” Spaace 走得不是那种一次性爆发交易量的路线,而是在逐步把 NFT 交易转变为一种可持续参与的行为链条。在它的生态里,每一次挂单、浏览、任务参与不仅能获得奖励,还会形成一个更连贯的用户轨迹。你不再是“来一次、走一次”的游客,而是一个在生态里慢慢“成长”的参与者——这让 NFT 使用不再像一笔单一操作,而像一个可以反复进入、反复体验的互动空间。 Veera — 让链上入口变成你愿意点开的“探索入口” Veera 的方向并不只是做一个钱包,它试图把 Web3 的入口从命令式的“按钮堆栈”变成一种更像信息流的自然浏览感。你打开它,不是看到一墙按钮,而是像打开一个可以滑动、查看和探索的界面。这种把“入口”变成“探索空间”的思路,让用户从“被迫了解复杂操作”转向“顺手发现有趣内容”的习惯性行为,这对提高留存和用户连续参与是非常重要的一步。 MagicBlock ✨⬜ — 把实时体验和可扩展性带到链上应用 MagicBlock 是一个基于 Solana 的实时执行引擎,目标是让链上应用具备Web2 级的交互性能,并且保持去中心化的安全性。它使用 Ephemeral Rollups 技术,在不拆分状态的前提下提供极低延迟、几乎零手续费的执行环境,这适合实时游戏、DeFi 以及需要高频交互的场景。其设计让开发者不再为性能牺牲链上特性,同时也极大提升了用户“无延迟感”的体验可能性。 除了技术本身,MagicBlock 还在孵化器层面发力,吸引开发者来构建更具创意和实时性质的应用,这让生态不仅是底层引擎,更成为创新场景的催化器。 Altura — 资产不再只是标签,而是可调用的“行为构件” Alturax 的核心变化在于,它让链上资产具备更强的生态参与能力:不是只有买和卖的逻辑,而是一种资产在不同协议与玩法之间调用的能力。资产不再是静止的符号,而是可以参与多种逻辑、被策略调用的构建块。这种思路让资产在链上进一步融入生态协同,而不是只能在市场上看价格。 Konnex — 把现实世界的任务纳入链上协作图谱 Konnex 的有趣点在于:它不单是一个链上协议,而是试图把现实世界的不确定性直接带进链上。在它的构想中,机器人、自动化系统和协议之间可以协作,通过链上可验证的数据完成现实任务的结算 —— 使得现实世界的执行与去中心化结算建立起一种可验证的信任。 这是 Web3 往现实落地迈出的一步,不再把链上交互限定在数字资产,而是融入实体世界的执行逻辑之中。

搞子(明日香版)🕊️|🐬TermMax

102,534 görüntüleme • 7 ay önce

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 görüntüleme • 2 ay önce