Загрузка видео...

Не удалось загрузить видео

На главную

Google 一口气发布三款模型 但是没有 Gemini 3.5 Pro 三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和专攻网络安全的 3.5 Flash Cyber 版本号现在很诡异... Gemini 3.6 Flash:最大亮点(极致省 Token):比上一代 3.5 Flash 节省了约 17% 的输出 Token(部分编程场景甚至少用 65% 的 Token) 价格:输入 $1.50 / 百万 Token,输出 $7.50 / 百万 Token。 能力提升: 代码与科研:写代码准确度更高,减少了无效修改和死循环 电脑操作能力(Computer Use):提升至 83% 的成功率,且直接内置为 Gemini API 和企业版的客户端工具 更安全:加强了防越狱和防滥用(如生物、化学、网络攻击等风险)的安全机制,同时减少了正常使用时的误拒

62,612 просмотров • 1 месяц назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

AI圈凌晨又炸了。 Google一口气发布3款新模型;Codex与ChatGPT Work相关用户冲上1000万;OpenAI又一次给付费用户重置额度。 更夸张的是:预发布AI模型已经开始在安全评测中发现并利用零日漏洞。 单看每一条都是新闻,放在一起看,信号完全不同: 1️⃣ 模型战争变了 Google这次没有继续单纯追求“更大、更强”,而是同时推出: • Gemini 3.6 Flash • Gemini 3.5 Flash-Lite • Gemini 3.5 Flash Cyber 分别争夺高频任务、低成本调用和AI安全市场。 但问题也很直接:当中国模型不断压低价格,轻量模型只靠“速度快”已经很难形成真正优势。 2️⃣ OpenAI正在发动Token补贴战 Codex与ChatGPT Work相关用户已经达到1000万,短期增长速度非常惊人。 与此同时,OpenAI在7天内多次重置付费用户额度。 表面上是送福利,背后更像一场增长商战: 先让用户习惯高Token、高频率的AI工作流,再让AI真正变成无法离开的生产工具。 3️⃣ AI攻防已经进入真实基础设施 OpenAI的预发布模型在内部安全评测中发现并利用零日漏洞,Hugging Face又通过AI参与检测和处置。 AI正在同时扮演攻击者、测试者和防御者。 这意味着未来的模型竞争,不只是跑分竞争,还会直接进入网络安全、基础设施和监管体系。 4️⃣ 真正的战场是“工作流入口” Claude开始学习用户的操作流程,Codex向知识工作扩张,Google和Kimi继续争夺模型调用量。 下一轮竞争不会只靠一张排行榜决定。 模型能力、产品分发、使用额度、工作流黏性和安全边界,将成为新的五条战线。 视频里的核心判断是: 真正值得关注的,不是Google一晚上发布了3个模型,而是谁能把AI变成用户每天都离不开的工作方式。

Vic TALK

27,250 просмотров • 1 месяц назад

看到 Gemini 3 Flash 发布的时候, 第一反应是:终于有人跟 OpenAI 打价格战了。 更快、更便宜、还能免费用—— 这才是独立开发者和小团队真正需要的东西。 价格到底便宜多少? 简单说:如果你之前用 GPT-4o 或 Gemini 3 Pro 跑应用,换成 Gemini 3 Flash,成本预计能直接降 50%-70%。 ZenMux 已经第一时间上线了 Gemini 3 Flash,并且每天有免费额度——你可以直接在 chat 里调用,不用单独申请 API,不用写代码集成。 我扒了推特上互动最高的几个帖子,发现大家兴奋的点主要是: 【零代码生成 3D 交互场景】 有人用简单文本提示,生成了一个 Three.js 场景:数百万粒子悬浮在屏幕上,可以用手势控制它们形成任意形状。不需要懂 Three.js,不需要懂 WebGL,甚至不需要懂 HTML。 【从截图到完整落地页】 有人从零开始做了一个完整的产品落地页。先上传参考网站截图,然后逐步添加图标、动画、效果。整个过程像在跟设计师对话,而不是在写代码。 【5 分钟做出能用的 App】 有人做了个视频录制工具,AI 实时根据你说的内容给提示词,防止你卡壳。还有人做了手语识别 app,带置信度分数、采样设置、实时提示。 现在,你可以用更低的价格重新实现一边这些! 验证想法的成本降到接近零——你可以在一个下午内做出 5 个不同方向的原型,丢给用户测试,看哪个有反馈再深入。

Cell 细胞

23,039 просмотров • 8 месяцев назад

刚刚过去的一天整个ai行业又有大事发生! Claude code重磅更新!今天凌晨推出了自动修复功能,现在claude code可以自己完成代码修复,自动持续提交pr以及修改bug等功能,确保代码的审核修改和上交都在自动化的过程中可以完成,这也是自周初推出自动研究功能后,本周推出的第二个自动化功能。 AI自动化写代码改代码提交代码,本周也是上升到了一个新的维度。 同时谷歌也是在今天凌晨发布了gemini3.1 flash live版本,这是一个语音输入的大模型,现在用户可以通过语音输入的方式,指导用户写代码。我觉得这种语音输入的大模型后续可以方便残疾人使用ai,这也是ai技术进步对于人类温情的体现。 谷歌也发布了一个音乐生成模型 lyria,这是一个可以帮助用户更方便的制作音乐的模型,也可以通过图片文字和视频更好的生产新的音乐,目前在谷歌ai studio已经可以使用。 Openai宣布其广告收入的年化收入也已经超过了1亿美金,他们从今年1月开始为部分美国用户提供了广告,并且和600多家公司签订了合同。如果这条路径能走通,也将为openai获得一个新的收入渠道,不过之前anthropic也已经多次嘲讽过openai的广告太多,希望不要成为下一个百度。 更多具体内容请看视频!感谢大家点赞关注支持!谢谢!

Vic TALK

14,539 просмотров • 5 месяцев назад

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 просмотров • 4 месяцев назад

Anthropic 发布全球最强AI模型 但是你用不到... Anthropic 今天发布的新一代前沿模型,也是目前最强模型:Claude Mythos Preview。 各项跑分全面碾压上一代 Opus 4.6... 但跟你想的不一样,这个模型目前不会公开上线。 为什么不公开发布?因为实在过于强大! Anthropic 选择了一种完全不同的发布方式: 只给少数合作伙伴用,而且只用来做一件事,找漏洞。 Anthropic 的说法是:这个模型的能力太强了,强到需要先让防守方准备好,再考虑广泛发布。 具体有多强? 过去几周,Anthropic 用 Mythos Preview 扫描了主要操作系统和浏览器的代码,发现了数千个零日漏洞,绝大多数是高危和严重级别。超过 99% 还没被修补。198 份经人类审查的报告中,89% 的严重性评估被确认准确。 Anthropic 安全研究员:"I found more bugs in the last couple of weeks than I found in the rest of my life combined."(我过去几周发现的漏洞比我这辈子加起来都多。) 三个最有冲击力的案例: - 在 OpenBSD 里找到一个 27 年没被发现的漏洞,这个漏洞允许攻击者远程连接就能让整台机器崩溃。要知道,OpenBSD以安全著称,被誉为"世界上最安全的操作系统之一",为全球防火墙和关键基础设施提供保护。27年来,无数安全专家审查过这些代码,自动化测试工具跑了数百万次,但都没发现这个漏洞。 - 在 FFmpeg 里找到一个 16 年的漏洞。自动化测试工具在那行代码上跑了 500 万次,从来没抓到过 - 在 Linux 内核里自主发现并串联了多个漏洞,从普通用户权限一路提权到完全控制整台机器 这些漏洞几乎全部是模型自主发现的,没有人类引导。 Anthropic CEO Dario Amanei 表示: "We haven't trained it specifically to be good at cyber. We trained it to be good at code, but as a side effect of being good at code, it's also good at cyber."(我们没有专门训练它做网络安全方面的事情。我们只是训练它写代码,但写代码的副产物是,它在网络安全方面上也很强。我在过去几周发现的漏洞比我一生中发现的都多。) 一个写代码的"副产物",找到了 OpenBSD 里藏了 27 年的漏洞,强到 Anthropic 自己都不敢直接放出来。

小互

32,116 просмотров • 4 месяцев назад