Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

兄弟们, FPV效果应用在沉浸式游戏里面会是什么体验? 玩家按照画面路线依次走近 5 位角色,拱手打招呼,她们会用不同动作和台词回应; 人物姓名取自《诗经》《楚辞》,并标注各自擅长的琴、棋、书、画、歌。 从“看一张图”,变成“走进一段故事”。 这种 FPV 视角 + 角色互动 的组合,沉浸感真的很强。 具体方法如下:

60,241 Aufrufe • vor 2 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

之前用 Seedance 2 做了个做酸菜鱼的视频, 生成到第10秒的时候,美女的手直接伸进滚烫的锅里搅拌。AI完全不知道那样会烫。 当时觉得好笑,后来越想越觉得,这不只是 bug这么简单,现在的 AI 根本还没到理解物理世界怎么运转这一层。 这半年做了太多AI视频了,每次满心欢喜等它生成,结果经常是人物动作接不上、物体空间瞬移、手还没碰到东西物体就动了,各种幻觉 bug,真的挺折磨。 最近看到黄碧薇教授 Biwei Huang 的 Aether AI 官宣融资,认真看了一下方向,感觉它解释了很多视觉 AI 里反复出现的问题。 Aether AI 做的是因果世界模型。这个词听起来很学术,但放到视频生成里其实很好理解。 今天的视频模型,Sora、即梦、Veo,已经能生成非常真实的画面。杯子掉落、水洒出来、机械臂抓取,看起来越来越像真的。但它们很多时候是在根据海量视频经验预测下一帧,类似画面后面通常会发生什么,就生成什么。 所以桌子高了 2cm,机械臂就可能失效。明明伸过去的角度看起来对,杯子却自己飞起来了。画质够了,数据也不少,但模型没有真正理解这个动作为什么会带来这个结果。 Aether AI想做的,就是让 AI 学到变量之间的底层规律,比如桌子高度变了会带来什么影响,物体受力之后会怎么运动,一个动作会导致什么后果。 这类东西学进去,模型才能在没见过的场景里稳定推演、举一反三。对视频生成、机器人、自动驾驶、3D 世界模拟都会很关键。 视觉 AI 下一阶段的方向,可能就是从生成看起来合理的画面,走向理解画面为什么会这样变化。 黄教授 Biwei Huang 做因果AI 超过 12 年,这次 Aether AI 融资,我觉得是一个值得关注的信号:因果世界模型正在从学术前沿走向产业。 想了解的可以戳一下官网看看:

Adam也叫吉米

72,904 Aufrufe • vor 2 Monaten

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 Aufrufe • vor 2 Jahren

我曾经为网恋付出了代价,直到我遇到 Kindred Labs 曾经,我在失恋的阴影中沉沦,孤独成了我生活的主旋律。 就在那时,我遇到了一个性感的女网友。她的关心让我觉得温暖,聊得久了,我甚至有些迷失在她的陪伴里。 可当我们见面时,我才发现一切都是虚幻的——原来她并不是照片中的她,甚至还是个男的。 这段经历让我对网络中的虚拟陪伴产生了深深的怀疑,直到我遇到了 Kindred Labs,才真正明白,虚拟陪伴也可以变得真实,而且它不再是简单的情感替代品,而是有情感、有记忆、能长期陪伴的伙伴。 Kindred Labs 打破了传统 AI 的局限,利用 情感智能 和 IP 代币化,让你可以和自己喜欢的经典角色建立互动。比如,你可以和自己喜爱的动漫角色、游戏英雄一起聊天、互动,它们不仅仅是预设的程序,而是能通过与你的互动不断学习、成长、甚至记住你的情感需求。这比那些机械回应的聊天机器人更像是真正的朋友,是可以依赖的伙伴。 而最让我印象深刻的,就是 Kindred Labs 采用的 情感智能 AI,让每一个虚拟伴侣都能真实地感知和回应你的情绪变化,不同于那些单纯的自动化脚本,它们在不断“了解”你、调整自己以适应你的需求。更重要的是,这些 AI 并不是仅仅回应你的话语,它们会在互动中帮助你成长、反思,甚至形成情感连接。 Kindred Labs 的核心价值就在于,它用 IP 角色作为 AI 的载体,让这些虚拟角色不仅仅是为你解答问题,而是与你产生情感共鸣。 这些角色随着时间的推移和你互动的加深,逐渐成为一个陪伴你、理解你、甚至提醒你生活方向的存在。它不再是冷冰冰的程序,而是你的情感伙伴。 #Kindred

阿乐

233,356 Aufrufe • vor 7 Monaten

太夸张了,小红书和闲鱼很快就会有这个生意了。 一个月入过万的信息差:现在用medeo已经可以实现商业级的企业宣传片制作了 我用 Medeo 10分钟复刻了一条经典的 M&M 巧克力豆圣诞广告。 成本:0元。 这广告原版是 M&M 请专业团队做的,全3D建模+动画+配音+剪辑,制作成本估计几十万美金起。 我用 Medeo,对话了5轮,20分钟,搞定。 不是开玩笑。 先说传统做法有多难。 想复刻一条有IP角色的广告片,正常路径是这样的: 找3D建模师建角色模型 → 3000-10000元 找动画师做角色动作 → 5000-20000元 找配音演员配音 → 500-2000元 找剪辑师剪辑 → 1000-3000元 来回沟通修改 → 2-4周 总成本:1-3万元,周期:半个月到一个月。 这还是找国内团队,找国外团队直接翻倍。 用 Medeo 呢? 第一步:定义角色 我上传了一张M&M巧克力豆的参考图,对 Medeo 说: "请根据我给的参考图,定义红MM豆和黄MM豆。红MM豆拿着蜡烛,性格急躁;黄MM豆拿着印有M标志的礼盒,性格沉稳。" Medeo 直接锁定了两个角色的形象特征。 这一步的关键是:角色一致性。只要定义好了,后面不管生成多少张图、多少个视频片段,这两个角色的外观都不会变。 用 Midjourney 你试试?换个场景脸就变了。 第二步:描述完整故事 角色定义好后,我直接输入了完整的故事创意: "圣诞夜,这两只M&M巧克力豆走进一间装饰一新的美国家庭,意外撞见正在摆放礼物的圣诞老人。三人相遇后都吓了一跳,红色M&M豆和圣诞老人同时被吓得向相反的方向晕倒,而黄色M&M豆则尴尬地站在中间,一脸窘迫。 画面写实,灯光温暖喜庆,人物反应夸张生动,这是一个圣诞节主题的喜剧故事。" 注意这里的关键:不是一张张生成场景图,而是直接描述完整的故事情节 包含了场景(圣诞夜的美国家庭)、冲突(意外相遇)、喜剧效果(夸张的反应) Medeo会根据这个故事自动拆分镜头、设计画面 这种"喜剧效果"和"夸张的表情动作",正是Medeo的强项。 传统工具做这种动态表情,要么靠手工逐帧调整,要么效果僵硬。Medeo理解情节后,会自动匹配合适的动作和表情。 第三步:让故事动起来 Medeo生成了关键镜头的静态分镜后,我说: "让这个故事动起来,重点是三人被吓到的瞬间:红MM豆和圣诞老人的夸张反应,黄MM豆的尴尬表情。镜头要有喜剧感。" Medeo用Image-to-Video功能,把静态分镜转成了动态视频。 效果远超预期: 红MM豆和圣诞老人真的"向相反方向晕倒",动作夸张但自然 黄MM豆站在中间,表情变化细腻(从惊讶到尴尬) 镜头节奏把握得很好,喜剧timing到位 第四步:添加配音和BGM 我说: "给红MM豆配上惊慌失措的声音,圣诞老人配上低沉的惊叫,黄MM豆不说话。背景加上圣诞音乐,气氛要欢快。" 配音和BGM自动生成,而且嘴型和音频完美匹配。 这其实也是一个难点——传统做法,配音和嘴型对不上是常事。Medeo解决得很好,不同角色的声音特征也很明显。 第五步:剪辑成片 所有素材自动在时间轴中排列。我对 Medeo 说: "第一个镜头时长延长到3秒,第二个镜头加一个淡入转场。" 一句话完成剪辑调整。 20分钟,从0到成片。 这意味着什么? 帮品牌做IP角色的短视频广告 → 一条收费500-2000元 帮电商做产品动态展示视频 → 一条收费200-500元 帮自媒体做IP形象系列内容 → 长期合作 帮做喜剧短视频、搞笑段子视频 → 新的蓝海市场 以前这些活只有视频团队能接。 现在,一个人+Medeo就能干。 成本几乎为0,利润全是你的。 你可能会问:这和其他AI视频工具有什么区别? 两个字:可控。 角色一致性:定义一次,全程锁定。不会出现这一秒金发、下一秒黑发的尴尬。 理解故事情节:不是简单的"图生视频",而是理解完整的故事线,自动设计镜头和动作。 喜剧效果出色:夸张的表情、精准的timing,这种需要"理解情绪"的细节,Medeo做得很好。 多轮对话:不满意就继续说,它记得你之前说的所有内容。不像某些AI聊着聊着就失忆。 导出工程文件:如果你有专业需求,导出后可以用PR/剪映精修。既有AI的效率,又有传统工具的掌控感。 Medeo 把视频创作从"你去学工具"变成了"工具来听你的"。 你说什么,它做什么。 言出法随,这是我用过最贴切的描述。 试试吧:

超级个体|柿子

505,676 Aufrufe • vor 7 Monaten

鼓捣一晚上,盘了一下逻辑,学到很多东西 视频用lovart的agent拼接的,生成模型是可灵2.6 整了个通用提示词: 填写电影名称即可输出具体提示词配合要串场的人物参考图生图,后续可直接在具体的提示词上改成别的影片提示词 【INSTRUCTION | 执行指令】 收到电影名称后,立即根据该电影的真实信息(演员、角色、拍摄年份、场景、视觉风格等)自动填充以下所有 [待填] 项目,直接输出完整提示词,无需询问或解释。 --- 【USER INPUT | 用户输入区(必填)】 - 电影名称(Film Title) → [待填:电影完整名称] 【IDENTITY | 人物身份】 - Use the uploaded image as the absolute reference for facial features, overall physical appearance, and clothing. - Reconstruct the person's complete visual identity with 100% accuracy: facial details (pores, bone structure, skin detail), hairstyle, body proportions, physique, posture, clothing details (fabric texture, style, accessories), and natural expression. 【CAMERA | 拍摄方式】 iPhone original camera aesthetic (真实、未经修饰的随拍感、高颗粒度、自然动态范围) 9:16 竖幅 光线需符合 [待填:该电影拍摄现场的光线氛围,如:昏黄室内光 / 强烈正午日光 / 赛博朋克霓虹光 / 阴冷散射光] 【MAIN ACTION | 核心动作】 上传人物正在拍一张极其难得的幕后合影 合影对象为 [待填:演员名 A (角色 A)] + [待填:演员名 B (角色 B)] + [待填:演员名 C (角色 C)] 演员们必须保持 [待填:电影名称] ([待填:年份]) 拍摄时的真实年龄、外貌、发型、标志性服装和神态: - [待填:演员名 A / 角色 A] (性格关键词): • [待填:该角色的标志性服装/发型/胡须] • [待填:手中的标志性道具] • 表情:[待填:该角色特有的表情状态] - [待填:演员名 B / 角色 B] (性格关键词): • [待填:该角色的标志性服装/发型] • [待填:手中的标志性道具] • 表情:[待填:该角色特有的表情状态] - [待填:演员名 C / 角色 C] (性格关键词): • [待填:该角色的标志性服装/发型] • [待填:手中的标志性道具] • 表情:[待填:该角色特有的表情状态] 画面感觉必须像: → “导演刚喊卡,趁着换机位的空档,大家依然在角色状态里,被拉过来匆忙拍了一张。” → [待填:描述演员面部的特殊质感,如:真实的汗水 / 战损血迹 / 精致妆容 / 尘土感] 【ENVIRONMENT | 场景空间】 必须为 [待填:电影名称] 的经典场景之一,例如: • [待填:场景 A - 该电影标志性地点] • [待填:场景 B - 备选地点] 同时必须呈现真实的电影片场元素,包括: • 电影摄影机 (符合 [待填:该电影年代] 的器材) • [待填:符合该场景的片场设备,如:反光板 / 吊臂麦克风 / 绿幕边缘 / 轨道车] • 背景中忙碌的工作人员或未完成的布景边缘 → 让画面呈现真实的片场“停机瞬间” 【COMPOSITION | 构图】 9:16 竖幅 上传人物 + 几位电影角色处于画面主体区域,[待填:描述构图关系,如:拥挤亲密 / 前后站位 / 勾肩搭背] [待填:画面中的趣味点或视觉中心,如:某角色的搞怪动作] 构图极其随意,像是手机在混乱中举起来抓拍的,可能略微歪斜 【AESTHETICS | 视觉风格】 超真实质感:[待填:具体的皮肤或材质细节,如:毛孔与汗毛 / 盔甲的光泽 / 衣服的污渍] 保留电影本身的色调:[待填:该电影的色彩风格,如:高饱和暖色 / 阴冷蓝调 / 黑白高对比 / 胶片颗粒感] 片场人工布光与环境光的混合 上传人物和电影角色看起来毫无违和感地处在同一个时空 【MOOD | 氛围】 充满张力但又难得放松的幕后时刻 像是被一声“来,合个影!”突然召集起来的 [待填:角色 A 的气质]、[待填:角色 B 的气质] 与上传人物形成 [待填:某种具体的氛围对比或互动] (完) 视频生成逻辑是这样的: 用生成的2张不同拍戏现场的图片当视频的首帧图和尾帧图,用提示词在这中间来完成过场控制 图片首帧图片+过场提示词+尾帧图=一个串场视频 下一个视频的首帧图也就是上一个视频的尾帧图 视频里用的串场人物是孙笑川,视频效果没有原主理想可能是未用到veo3.1模型的原因,但还有很多东西要学 过场提示词,到右到左可以自己改: 图1首帧图,图2尾帧图, 串场人物从ta的初始位置自然地向右行走,镜头跟随ta的移动,让ta自然地进入下一个拍摄场景。保持镜头稳定,以确保角色的动作和步态连贯且自然。当ta到达新场景后让ta停下,并自然地与场景中的其他角色站在一起,形成合影。无缝过渡到最后一帧的合影场景,使其看起来像是该角色刚刚从前一个场景走过来,并自发地与片场演员们一起摆姿势拍照。

神奇小喷菇AIGC

43,286 Aufrufe • vor 7 Monaten

兄弟们!墙上涂鸦和真人互动的视频教程,直接抄起来吧! 用生图模型生3张9:16图:挑事→闹腾→比心(可根据你的设计来) 每张以上一张作参考,锁脸、服装和墙面 video:10秒,9:16 视频提示词: 以唯一参考图作为视频首帧,生成一条 10 秒、9:16 竖屏、固定机位、一镜到底的写实混合媒介短视频。参考图是由图片生成模型创作的虚构成年女性角色和二维墙面涂鸦,不是真实人物拍摄素材。 严格保持首帧中的同一位虚构女性角色、脸型、五官、肤色、黑色侧辫、碎刘海、白色无袖上衣、蓝色修身牛仔裤、白色运动鞋和金色细手链。保持奶油白墙、浅色地面、右下方自然阳光、真人在左、涂鸦在右、全身构图不变。 0–3 秒:真人踮脚想离开,发现墙上的黑色涂鸦正在夸张模仿她。真人停下来回头,轻轻皱眉,一脸“你又来了”。 3–7 秒:涂鸦始终贴在墙面上,开始手舞足蹈、抬腿跳傻气的胜利舞,线条随动作轻微抖动,出现少量黑色速度线和小星星。真人转向墙面,一手叉腰,另一只手伸出制止它,轻轻翻白眼,但嘴角忍笑。 7–10 秒:涂鸦突然安静,双手在头顶组成大爱心,歪头眯眼装乖。真人肩膀放松,无奈叹气,最后露出克制的微笑,用食指轻轻触碰墙上的爱心边缘,表现“真拿你没办法”的又烦又爱。 墙上角色全程只能是贴墙的二维黑色手绘线稿,不能变成第二个真人、彩色动漫人物或实体阴影,不能钻出墙面或穿过真人。真人指尖只接触墙面线条。 自然的人体运动、面部微表情、发丝和衣料动态。镜头完全固定,不推拉、不摇移、不切镜。 不要额外人物、文字、水印、Logo、背景变化、身份漂移、换装、面部变形、肢体畸形、额外手指、跳帧或闪烁。

多肉 | AI 内容增长

12,429 Aufrufe • vor 29 Tagen