Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

这张海报,连文字和排版都是 AI 一起生成的! Ming-Image-0.1-Design 这次的出图效果挺惊艳,标题、主视觉和配色已经搭成了一张完整海报,拿来做设计初稿很合适。 它是 inclusionAI 的 6B 文生图模型,官方重点面向 UI、信息图、海报这类带文字和版式的设计。我这次选了一张科技风海报来试,正好能一起看文字、构图和材质。 我通过 OpenRouter API 生成了下面这张 2048×2048 的图,几个地方可以直接看。 1、标题有主次。指定的 AI DESIGN FLOW 放在上方,字号够大,下面接一行小字,第一眼就知道该看哪里。 2、三张卡片有关系。输入、界面、图层用箭头串在一起,能顺着画面看懂这个流程。 3、整体风格比较统一。深色背景配蓝紫色发光边框,卡片的玻璃质感也做出来了,做科技类内容的封面很合适。 这次提示词里,我提前写了三张卡片分别放什么、标题用哪些字,也交代了配色和留白。想让它出一张能用的设计稿,这些具体要求很值得写进去。 不过它也多加了没要求的底部英文,正式用之前还得检查文字。这次只试了英文标题,中文长段落的效果还没测。视频里的动效是后期做的。 我的建议是,拿一张你正好要做的封面来试,把用途、标题和主体位置写清楚,让它先出初稿,再改具体细节,别只给一句“做得高级一点”。

27,597 Aufrufe • vor 5 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

刷英文推特最烦的,是一条消息还没看完,就得在推文、截图、视频和翻译软件之间来回切换。 沉浸式翻译沉浸式翻译 这次的更新,瞄准的就是这些打断阅读的小麻烦。 尤其是 BabelFast 极速翻译和圈选翻译,对经常看海外资讯、研究项目、跟英文社区交流的人,很有吸引力。 拿大家熟悉的场景来说:一个海外项目突然发了公告,正文里挂着链接,配图里写着规则,评论区又有人补充细节。 真正要搞清楚这条消息,你得把这一整串信息都看明白。 沉浸式翻译支持推特正文和评论区实时双语对照,这次还针对带复杂超链接、预览图的“卡片”推文重构了底层交互。 看公告时对照原文核实措辞,刷信息流时也可以切到“仅译文模式”,减少中英文交错带来的阅读负担。 而新出的 BabelFast 翻译引擎,是 Pro 功能,主打极速翻译。 连续看几十条推文时,每次翻译都等一下,很容易把阅读节奏打散。 BabelFast 的价值就在这里:缩短等待,让翻译更跟得上你刷信息的速度。对于每天需要浏览大量英文内容的人,这个方向比多一个花哨按钮实在得多。 另一个更有意思的更新是圈选翻译。 很多关键信息根本不在可复制的正文里,而是在项目海报、规则截图、数据图注,甚至一张梗图里。 看到不懂的地方,直接圈选那块图片或网页区域就能翻译。 比如白名单海报上的参与条件、研究配图里的英文说明,不必为了读懂几句话,先折腾截图、识别、复制、粘贴。 图片之外,推特视频也能直接翻译;遇到没有字幕的视频,还可以用 AI 字幕。 看海外访谈、产品演示,终于多了一种理解内容的方式。 直播翻译则可以放到 YouTube 新闻直播这类场景里用,跟着正在发生的信息看。 还有一个适合评论区选手的功能:输入框翻译。 想回复海外朋友、给项目方留言,或者换英文关键词搜索,可以先用中文输入,三击空格,再稍作停顿,转成目标语言。 写了一大段,只想翻译其中一句?选中那句话,按 Alt + I,Mac 用 Option + I,就能精准处理选中部分。 发出去之前再检查一下语气和专有名词,交流会省事很多。 对我来说,这类工具最值得关注的地方,是让读信息和参与讨论变得更连贯。 看得懂正文,也看得懂图里的细节;能跟上视频,也能把自己的想法说出去。 如果你每天都在英文推特里找信息,建议优先试试这三个场景:BabelFast 连续刷推、圈选翻译英文配图、输入框翻译英文回复。 都是每天会碰到的小事,也最容易看出一个工具到底有没有帮你省下功夫。

pandaWL

112,543 Aufrufe • vor 15 Tagen

不花一分钱快,速用Seedance2.0生成真人质感的假面全网爆火的打斗短视频呢? 就是已经被说烂随便app和豆包,具体怎么操作,我先分享这个提示词再我写个文吧,这些app每天10次的抽卡加上豆包10个积分机会其实足够生成一个小片段用的,只要你的提示词写得好,抽卡几率也大大降低! 另外再分享一个小云雀上都有的、但是热度一直很高的提示词,作为一名合格的搬运工!! 我必须要说的是,这些其实都可以找豆包写的,完全不用问东问西,更不用付费!!!!(因为我抠搜,我至今没花过一毛钱在ai软件,gemini的其实也算是白嫖的) 最近因为敏感词和IP等不再提供假面、铠甲变身的素材,导致很多提示词不能用?那不是因为词的问题,问题在你的图,不要去垫图,用自己画的假面或者机甲,下面你只需要准备三样素材(正派、反派、背景(根据需求,也可以文字描述): 1️⃣主角:@你的数字人/@图1的cos真人版(不要用IP) 2️⃣主角变身后:@图2(一定得用真实的照片,最好用mj/grok艺术化以后,用🍌转成真实风格(一定是写实的)保证成片! 3️⃣反派:@图3/你用文字描述的即可(各大app一大堆) 4️⃣场景:@图4(如果你需要固定场景的长篇幅确保一致性,必须要垫的图) 这样只用写动作和特效即可!(提示词我放在评论区了)👇👇👇 基本能保证你的账号日更基本不成问题!👇

𝟡𝟜 ᴾᴸᴬʸᶠᴼᴿᴳᴱ

52,996 Aufrufe • vor 7 Monaten

被 Astra 震撼后的一个顿悟 —— 要给自己配置无限额度的最强算力 下午 Tibo 重置之后,我又满血复活了,然后重新跑了一个工作任务,做培训资料。 在这之前,因为额度不够,我先用 DeepSeek 4.1 做了一些信息抓取,也跑了一版培训资料。结果怎么说呢,生成出来的东西基本就是一坨,完全不具备可用性,还花了很多时间,烧了大几百万、甚至上千万 token。 这过程中我还顺手研究了一下 CC Switch 和 Open Code X,真挺有意思的。 CC Switch 我感觉做得非常棒,比较轻量,Open Code X 也有一些可取之处。这两个东西如果以后有人能融合一下,我觉得会很有意思。 话说回来。 Tibo 重置之后,我把同一个任务重新交给 Astra 跑了一遍。 结果出来的时候,我直接傻了。 它把我原来文件夹里的资料重新抓了一遍,又结合自己检索到的一些信息,最后整合成了一份可以直接拿来做培训的资料。 最让我惊讶的是,它还帮我配了对应的图片和演示视频。 而我的资料文件夹里,其实相关视频并不少。但它最后挑出来两个,刚刚好就是在我看来最有代表性、也最能说明这个功能的两个。 这个感觉就很夸张。如果只是抓资料、做总结,那还是效率工具。 但它能从一堆素材里面,挑出最适合放在这里的内容,那一瞬间我真的感觉: 它理解了这个东西。 不是简单的检索,也不是信息拼接。 它知道这个培训资料想讲什么,也知道什么东西最适合拿来说明。 有那么一瞬间,让我感觉 AGI 了。 然后我脑子里面冒出来一个非常现实的想法: 我还招什么人? 至少资料检索、竞品研究、培训资料整理、信息汇总这一类工作,我招一个实习生,真没有一个 200 刀的 Pro 账户有用。 而且还便宜高效得多。 我现在只恨一件事: 当初为什么没有多囤几个 200 刀的 Pro… 下一个目标,就是等重新开放之后,给自己配置无限额度的 Pro 账户。 另外下午还跑了一个鹈鹕测试。我不懂背后的运动学细节,但成片的协调、平衡和 taste 已经很惊艳。 9分钟就跑出了这样的效果,很高级 视频放在下面,大家可以自己感受。 “今天,骑得开心”

Robinson · 鲁棒逊

40,281 Aufrufe • vor 26 Tagen

兄弟们,最近我扒了全网比较好用的电商提示词,做了一套「全平台通用电商视觉引擎工作流」。 目前已经在 SkildArt 跑通: 上传一张产品图,就能生成 12 张电商套图。 重点不是让 AI 随便出一张好看的商品图,而是把电商视 觉拆成可复用流程: 主视觉/产品中心图/卖点图/场景图/细节图/规格图/横版首屏图 每张图都有明确用途。 产品不能变形,Logo 不能乱跑,卖点不能瞎编,整组图风格要统一。 我实测下来,SkildArt 这类电商视觉工作台确实更适合做成套内容: 无限画布适合搭复杂生图流程; Agent 对话适合单张图灵活设计; 局部修改很方便; 视频模型也能和画布结合使用。 我还复刻了最近很火的「低能量穿搭换装」视频。 先在画布生成两组穿搭场景: 一组普通职业 Look, 一组明亮夏日多巴胺配色。 再切到视频模型,输入简单的转场和运镜描述,就能生成换装视频原素材。后面简单剪辑加 BGM 就能发。 以前这类内容要实拍两套造型,还要对镜头和节奏,现在工作流能直接把门槛拉低很多。 我觉得 AI 电商图真正的价值,不是单张图好看,而是稳定生成一整套能卖货的视觉资产。 完整工作流和低能量穿搭复刻提示词,可以去 SkildArt 广场搜关键词: 电商系统通用、夏日多巴胺换装 全部开源到里面了

知识猫AI实验室

89,146 Aufrufe • vor 3 Monaten

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

55,427 Aufrufe • vor 3 Monaten

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 Aufrufe • vor 2 Jahren

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 Aufrufe • vor 5 Monaten

Anthropic 在 2026 年 9 月 17 日公布了一组进展:在两名技术人员监督下,Claude 用了不到四周时间,协助优化了 30 多个开源生物学模型,其中包括 AlphaFold3 和 Boltz-2,相关优化代码已经开源。 这件事情吸引人的地方,在于它处理实际科研代码的具体过程,也就是从进入工程仓库、定位问题、修改代码,到最后一步步拿指标做检查。 顺着这种科研工作流的思路,我最近试用了 ScienceBuddy。它是 PhAI Labs 推出的生物医学 Agent 工作台,我先用它跑了一个具体的文献梳理任务。 我给出的提示词是整理近几年用机器学习预测 CRISPR-Cas9 脱靶活性的相关研究,主要看基因编辑在目标区域之外产生误切的情况。 为了方便后续比对,我直接指定了输出结构,要求把研究任务、数据规模、主要发现、研究局限和 DOI 整理成规整的列。 ScienceBuddy 在当前任务窗口里生成了一张论文信息表格。不同研究使用的数据集、得出的结论以及原文入口被归纳在同一套字段下。这样的交互挺省事:输入的提示词、生成的表格以及后续的追问都停留在同一个工作界面,左侧列表也保留着历史任务记录,随时可以点回来继续补充条件。 拿到了整理好的表格,我抽查了其中一行,点击 CRISMER 对应的 DOI 链接,跳转到了 bioRxiv 上的原始预印本摘要。 表格里抓取的 CHANGE-seq 和 SITE-seq,确实是原文摘要里明确写出的训练数据;论文自身报告的 F1 值为 0.728、PR-AUC 值为 0.818,也逐字出现在摘要数据中,页面同时标有预印本提示。这里需要说明,这些准确率数值是 CRISMER 那篇论文自己的实验结果,并不是软件的性能数据。这次抽查做的事情很简单,就是顺着生成结果里的来源链接,确认关键字段能不能在原文里找到出处。 在另一个关于 GEO 公开组学数据的任务中,我查看了它的运行轨迹(Trajectory)。界面上展示了 query_geo、fetch_source、query_pubmed 等工具调用节点,清晰记录了系统在推进任务时尝试发起的查询动作。 关于底层的实现,项目方提到 ScienceIDE 是 ScienceBuddy 的底层技术框架,主要作用是把真实的科研代码封装成 Agent 可以执行、练习和验证的环境,并尝试通过科学标准来检查结果。面向普通用户日常使用的产品是 ScienceBuddy。 整套体验下来,最直观的感受是ScienceBuddy 把文献线索集中整理成表,并在同一个任务流里继续追问,遇到关键数据也能够直接从引用中找到 DOI 回原文做核对。 产品访问地址是 PhAI Labs 开发。我体验的时候 Preview 版本处于免费开放状态。如果平时需要梳理生物医学领域的论文脉络或收集开题证据,可以找一个具体课题试一试。

雪踏乌云

60,940 Aufrufe • vor 15 Tagen