Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

卧槽,Chrome “灵魂级”的更新来了! 我看完之后觉得这次Chrome 的升级有很多 “炸裂”的功能那个,直接把Gemini继承到浏览器,从此Gemini从被动助手升级为主动代理。 2026 版 Chrome 的全能日常: 1. 代理式自动浏览:以前订酒店,得开 10 个标签页手动对比价格、看评价、查距离。 现在说一句:“帮我订一套 2 月去大理的酒店,要能看海、带浴缸、预算 1000 以内,且离我之前收藏的那家咖啡馆走路 10 分钟以内。” Gemini 会: 自动像个“幽灵”一样在后台飞速闪过几十个网页,把对比结果直接列成表。 更离谱的是: 它能替你填写那些烦人的入住信息表单,甚至在确认后帮你完成预订。你只需要点一下“支付”确认,全流程自动化。 2. Nano Banana:网页上的所有图片,现在都是你的“素材库” 看到网页上模特穿了一件超酷的外套,但颜色不喜欢?或者看中了一套沙发,想看看摆在你家客厅是什么样? 现在: 通过内置的 Nano Banana 图像模型,你直接右键点击网页图片: 一键换装: “把这件衣服换成深绿色,材质改成皮质。” 画面瞬间实时渲染,效果真实得像原图。 无缝合成: 拍一张你家客厅的照片拖进去,Gemini 会自动通过空间计算,把网页上的家具“瞬移”到你家照片里,阴影和透视完全对齐。它不仅是浏览器,它是个顶级家装设计师。 3. Workspace 深度集成:你的浏览器“长了记性” 以前 AI 只知道你当前在看什么。现在的 Gemini 真正实现了“全知全能”。 读心术:...

61,132 Aufrufe • vor 8 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

说实话,这才是我想要的AI该有的样子。 前_buildspace创始人Farza刚刚发布了Clicky,一个住在你Mac光标旁边的AI伙伴, 你不用打开任何App,不用打字,只要对着屏幕说一句话, 它就会分裂出一个小代理, 直接帮你把活干了。 你说,帮我把桌面这些乱七八糟的截图清理一下, 它就自动给你分类归档。 你说,帮我明天晚上九点设个提醒和Sharif去吃饭,它就直接打开提醒事项帮你建好。 你说,帮我找25个粉丝不到五万的同领域微网红,列成CSV再写几条DM模板, 它就自己上网搜,自己整理,几分钟给你一个现成的表格。 最离谱的是这个, 你说,帮我建一个Mac App,控制本地的Spotify,做成复古唱片机风格,有播放暂停显示歌名,五分钟之后,它真的给你编译出了一个完整的原生App,还自动打开给你运行。 以前所有的AI,都是你去找它,你打开聊天框,你打字,你复制粘贴,而Clicky是它一直在你身边,它看得到你屏幕上的一切,你需要的时候喊一声,它就出来帮你搞定。 Siri会告诉你,我帮你打开提醒事项,然后让你自己填,而Clicky会直接帮你填好保存,这才是真正的AI助手,不是聊天机器人,是你的数字员工。 现在已经可以免费下载了,Mac用户直接冲,这绝对是2026年到目前为止,最让我兴奋的AI产品。

AYi

14,316 Aufrufe • vor 5 Monaten

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

37,185 Aufrufe • vor 19 Tagen

🔥AI搬回本地! $NVDA 黃仁勋剛剛宣布重大突破, 个人电脑迎来全新时代! ———————————— 过去四十年,一直是你在伺候电脑。 这一次,它要反过来。 我们这代人,是被机器训练大的。记快捷键,清后台,等进度条,文件存在哪个文件夹自己得记牢,我们学会的全是“迁就它”,把自己一点点训练得像台机器,它才肯好好干活。 所以黄仁勋这次最重要的东西,很多人看漏了。不是又一个开源模型,也不是新芯片的跑分。是 AI 要从云端“搬回家”,住进你这台本机里。 这两年我们用的 AI,说穿了都是“租来的大脑”。你得先把家底打包上传:合同、工资条、还没写完的东西、和家人的聊天记录。它在别人的机房里跑,按别人的价收钱,入口攥在别人手里。聪明是真聪明,可它始终不是你的,你只是个访客。 而“本地 Agent”这四个字的意思是:这些东西,终于可以留在你自己屋里了。不用上传,不用排队,不用看网速的脸色。它能看你的文件、懂你开着的软件、替你把那些零碎活儿干完。第一次,电脑不再是你点一下它动一下的工具,而是一个会自己动手的人。 为了这件事,老黄把数据中心级的算力,上百 GB 的统一内存、接近一个 petaflop 的性能,硬塞进了一台摆得上书桌的小机器。不是为了让你在本地跑个玩具模型,是为了让你桌上这台电脑,真有本事自己干活。 往大了说,棋局其实很清楚:云端那颗大脑,继续在数据中心里想最难的事;你桌上这台,负责手脚,管你每天的柴米油盐。而老黄想要的,是大脑和手脚,两头都攥在自己手里。 但我更想讲的,是那种很具体的感觉。PC 是上一代互联网的入口,手机是移动时代的入口。下一个入口不在某个网站里,就在你书桌上那台开机的电脑里。谁先住进去,谁拿下下一个十年。 所以他这次真正想说的,从来不是“我们出了块更强的芯片”。 而是过去四十年,你把自己训练得越来越像一台电脑。 从今往后,是电脑,开始学着像你请来的那个人。

老白

15,858 Aufrufe • vor 3 Monaten

昨天母亲节,我回来家里陪妈妈吃饭,当小学教师的表妹让我给她演示下AI都有什么作用😂 刚好看到ring-2.6-1t 免费,我就试了下做个小红书很火的班级灵宠系统,本来以为应该要花点时间,但没想到速度惊人的同时质量也过硬! 这个 demo 让我最强烈的感受是:ring-2.6-1t 不像是在“回答我”,更像是在把我的想法直接推到现实里。 我只是生成了一个小学班级灵宠积分系统:学生打卡、做作业、考高分,就能给宠物攒积分、升级、冲排行榜的prompt。换成以前,这可能会停在一份 PRD、一张功能表,或者一段“你可以这样做”的建议里。 但ring-2.6-1t 直接把它变成了一个能打开的网页小工具。 你能看到全班宠物墙,能给学生加分扣分,能看等级进度,排行榜也会跟着变化。那一刻很微妙:它不再只是“懂你要什么”,而是把你脑子里的模糊需求,变成了一个可以被点击、被验证、被修改的东西。 这也是我觉得它最有价值的地方。 很多真实工作,其实不需要一套宏大的系统。我们只是需要一个临时的操作台:拆费用、排任务、调动画、做报名页、整理素材。用完就可以丢掉,但在那个时刻,它真的帮你把事情往前推了一步。 ring-2.6-1t的厉害,不是替你完成工作,而是先给你造出一个工作现场。然后,你在里面完成工作。 不得不说,我的表妹已经决定好好学习AI了,或许这就是好模型的意义。 Ring-2.6-1T 模型已经在openrouter发布了,限时免费一周,地址是

阿川 | AI thinking

13,489 Aufrufe • vor 4 Monaten

久等啦,创作者神器Viko终于上线!🥳( 前段时间我随手发过一个 Viko 的 demo视频,就那么一个很糙的版本,结果评论区和私信隔三差五就有人来问,什么时候能用,什么时候上线。 因为对我自己也是刚需,于是闭关爆肝了一个多月,终于来啦~ 它最开始,其实只是我给自己做的一个小工具。 我每天都会刷 Pin和各种作品站找灵感,我相信做 AIGC 视觉创作的人应该都懂。以前看到一张喜欢的图,我的流程是这样的,保存图片,丢进 GPT 反推拆解,复制出来改一改,再贴到生图工具里跑一遍。 做一张还好,一天几十张、上百张的时候,这套流程就显得非常非常繁琐。 所以最开始,我只想做一件特别简单的事: 看到好图,Viko 一下。 浏览任何网页的时候,鼠标悬停在图上,一键捕捉,一键拆解,直接进入下一步创作。 我也试过市面上很多反推插件,还停留在一个特别初级的阶段,丢进去一张图,吐回来一整段 Prompt。 坦率的讲,一整段 Prompt,对真正做创作的人来说,远远不够。 我真正想知道的是,这张图为什么好看。 它是什么视觉风格,构图为什么成立,用了什么镜头和光线,色彩关系是怎么组织的,材质、氛围、人物状态又是怎么形成的。 以及最关键的,到底是哪几个关键词,激发了这张图的「美学基因」。 所以Viko我希望是有这样的能力的 。 人像、动漫、商图、产品图等等,都可以沿着不同的视觉维度爆破拆解,风格、构图、镜头、光线、色彩、主体、材质、氛围,还有真正值得留下来的核心关键词。 你可以直接用完整 Prompt,也可以把某一个视觉元素单独抽出来,改一改,迁移到新的主题里继续二创。 一张图带给你的,就不再只是一句提示词。 你开始知道它为什么成立,也开始有了继续延展它的方法。 在这个基础上,我还做了两个我自己特别喜欢的模式: 第一个是色卡模式。 很多时候一张图让你第一眼觉得「就是这个感觉」,真正起作用的其实是那套配色关系。Viko 可以直接提取画面的核心色彩,把喜欢的配色留下来,迁移到完全不同的主题里。 第二个,是我个人觉得最爽的,内测期间大家最爱用的,动作参考模式。 人物动作一直是 AI 生图里最难搞的问题之一,所以viko针对此项做了专门处理,即使面对复杂肢体动作和高难度透视关系,也能从容、一键完成精准动作还原。 到这里,从一张灵感图开始,捕捉、拆解、理解、二次创作,这条链路已经通了。 但这就够了吗?of course not ! 今天反推出来的 Prompt,过几天还能不能找到? 刚发现的那个神仙关键词,下次创作的时候还能不能想起来? 那套很漂亮的配色、那个难得的动作参考、一次次验证过的构图,还有最后生成出来的作品,用完之后,去哪了? 散落在聊天记录里,收藏夹里,下载文件夹里,各种软件里。 每一次创作结束之后,我们其实都在丢失自己的经验,没有产生创作复利! 所以,资产管理慢慢变成了 Viko 更核心的一部分。 参考图、关键词、Prompt、色卡、生成的作品,每一次创作里真正有价值的东西,都可以也应该沉淀下来。 今天发现的一个关键词,可能是未来某张作品的起点。存下的一套配色,可以迁移到新的主题。 慢慢的,你留在 Viko 里的,就不只是一堆图和 Prompt 了。 它会变成一套真正属于你自己的,视觉创作资产库。 这也是我做到今天,越来越确定的一件事。 反推只是第一步。 找到一张图的美学基因,把它拆开、理解、重新组合,再把每次创作里有价值的东西留下来,让过去的积累继续参与未来的创作。 每一次创作,都应该让下一次创作变得更轻松。 所以! Viko 由 Chrome 插件和网页工作台两端组成,插件负责在你刷图的时候随手捕捉,工作台负责拆解和沉淀。插件在 Chrome 商店搜 Viko 就能装,网页端在 首发期间也肯定有福利送给大家,优惠码: VIKO20,首月直接8 折! 如果你平时也喜欢找图、研究风格、拆 Prompt、做二创,来试试。 看到好图,Viko 一下。

古一

239,275 Aufrufe • vor 1 Monat

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 Aufrufe • vor 5 Monaten