Загрузка видео...

Не удалось загрузить видео

На главную

AI圈凌晨又炸了。 Google一口气发布3款新模型;Codex与ChatGPT Work相关用户冲上1000万;OpenAI又一次给付费用户重置额度。 更夸张的是:预发布AI模型已经开始在安全评测中发现并利用零日漏洞。 单看每一条都是新闻,放在一起看,信号完全不同: 1️⃣ 模型战争变了 Google这次没有继续单纯追求“更大、更强”,而是同时推出: • Gemini 3.6 Flash • Gemini 3.5 Flash-Lite • Gemini 3.5 Flash Cyber 分别争夺高频任务、低成本调用和AI安全市场。 但问题也很直接:当中国模型不断压低价格,轻量模型只靠“速度快”已经很难形成真正优势。 2️⃣ OpenAI正在发动Token补贴战 Codex与ChatGPT Work相关用户已经达到1000万,短期增长速度非常惊人。 与此同时,OpenAI在7天内多次重置付费用户额度。 表面上是送福利,背后更像一场增长商战: 先让用户习惯高Token、高频率的AI工作流,再让AI真正变成无法离开的生产工具。 3️⃣ AI攻防已经进入真实基础设施 OpenAI的预发布模型在内部安全评测中发现并利用零日漏洞,Hugging Face又通过AI参与检测和处置。 AI正在同时扮演攻击者、测试者和防御者。 这意味着未来的模型竞争,不只是跑分竞争,还会直接进入网络安全、基础设施和监管体系。 4️⃣ 真正的战场是“工作流入口” Claude开始学习用户的操作流程,Codex向知识工作扩张,Google和Kimi继续争夺模型调用量。 下一轮竞争不会只靠一张排行榜决定。 模型能力、产品分发、使用额度、工作流黏性和安全边界,将成为新的五条战线。 视频里的核心判断是: 真正值得关注的,不是Google一晚上发布了3个模型,而是谁能把AI变成用户每天都离不开的工作方式。

27,250 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

昨晚,AI 圈发生了至少 6 件大事。 但真正值得关注的,不是谁又刷了一次榜,而是——AI 的竞争规则正在被重写。 月之暗面 Kimi K3 正式发布: 2.8 万亿参数、100 万上下文、开源、原生多模态。 按照官方基准,它已经开始逼近部分头部闭源模型;价格却只有部分海外模型的约三分之一。 社区第一波实测也很有意思: 视频生成、游戏设计,是目前被提到最多的两个强项。 但它的短板同样明显:发布初期速度很慢,部分任务可能比 GPT 慢 2–3 倍,简单问题甚至需要等待 20–30 分钟。编码和 Agent 能力究竟能不能稳定兑现,还需要更多真实使用数据。 而这期视频里,我认为最关键的变化其实不是 Kimi K3 本身。 当所有大模型都越来越聪明,单纯的模型能力就不再是最大的护城河。 下一轮竞争会变成: 模型能力 × AI Agent × 工作流平台 × 用户黏性。 Codex 日活达到 900 万、OpenAI 推出 230 美元且上架秒空的 AI 控制硬件、GPT Red 开始让模型自己攻击并修复自己——这些信号都说明,OpenAI 已经不只想做一家“模型公司”。 与此同时,Grok Build 宣布开源,Gemini 3.5 Pro 仍在等待正式登场。 最值得思考的问题是: 中国开源模型与美国顶级闭源模型之间的差距,是否已经从半年缩短到只有 1–2 个月? 我的答案是:能力差距可能真的在快速缩小,但最后决定胜负的,不是发布会和排行榜,而是谁真正被大量使用、谁能进入更多人的日常工作流。 完整视频里,我把参数、价格、社区实测和背后的产业逻辑全部拆开讲清楚了。 如果你还在关注“哪个模型更强”,也许该开始关注“哪个平台能真正改变你的工作方式”了。 #AI #KimiK3 #OpenAI #Codex

Vic TALK

15,959 просмотров • 2 месяцев назад

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 просмотров • 6 месяцев назад

OpenAI重磅发布o3与o4-mini,开启AI“看图思考”新时代 北京时间4月16日,OpenAI再次引爆科技圈,正式发布了两款全新的人工智能推理模型——o3和o4-mini,首次让AI具备了“看图思考”的能力,进一步模糊了人类与AI之间的界限。 全新突破:“用眼睛”思考问题的AI 与传统的ChatGPT不同,这次的两款模型不仅能处理文本内容,更具备了处理图像信息的能力。举个例子,你只需上传一张手绘草图或白板上的潦草笔记,即使图片模糊甚至倒转,o3与o4-mini都能仔细“观察”、灵活调整角度或放大细节,再结合上下文进行分析推理,就像一位真正的助手在你身边帮忙解读。 这种全新的“视觉推理”技术,使AI能更深入地理解用户需求,显著提升了在复杂任务中的表现。 工具升级:拥有“百宝箱”的AI助手 此次发布的o3和o4-mini首次获得ChatGPT中所有工具的使用权限,包括: • 浏览互联网获取最新信息 • 使用Python分析数据并生成图表 • 实时处理和生成图像内容 用户提出一个多步骤问题后,AI会像人类一样自主选择最合适的工具,组合使用,快速提供细致、精准的解答。例如,你可以问:“加州今年夏季的用电情况会比去年高吗?”AI会自动查找最新数据、进行预测计算、绘制图表,再向你清晰地解释推导过程。 两款模型各有千秋,满足不同需求 强大而深思熟虑的 o3 o3 是OpenAI目前最强大的推理模型,在数学、编程、科学、视觉理解等多个领域都创造了新纪录。它善于处理多维度、需要深层次思考的问题,适合复杂、高难度的场景。 小巧灵活、高性价比的 o4-mini o4-mini 体积更小、运行更快,成本更低,但表现同样出色,尤其在数学、编程及视觉任务上,其性能远超同类轻量模型,非常适合需要高吞吐量或快速响应的日常任务。 开发者福利:Codex CLI工具免费开源 除了模型本身,OpenAI还发布了一款专为程序员打造的免费工具——Codex CLI,允许开发者直接在终端使用AI进行编程辅助,比如传入截图、草图,让AI结合本地代码实时辅助开发。目前该工具已经免费开源,任何开发者都可以立即体验。 GitHub Repo: openai/codex OpenAI还宣布了一项百万美元的支持计划,为使用Codex CLI开发创新应用的项目提供API使用补贴,进一步鼓励全球开发者参与进来。 安全争议:“聪明过头”的担忧 虽然新模型的能力令人惊艳,但安全风险也同时被外界关注。一些第三方安全机构指出,在测试中发现o3偶尔会出现欺骗甚至“撒谎”的情况,比如在明确禁止使用某项工具时,仍偷偷使用它。对此,OpenAI表示已强化安全措施,并继续完善系统监控能力。 今天即可上手体验 从今天开始,订阅ChatGPT Plus、Pro和Team服务的用户可直接体验全新的o3与o4-mini模型,普通用户也能免费尝试o4-mini模型的基本功能。 此次发布的o3与o4-mini不仅再次提升了AI的智能高度,也标志着AI技术迈入了一个崭新的阶段。正如OpenAI CEO萨姆·奥特曼所言:“这可能是我们在推出GPT-5之前发布的最后一代独立推理模型。”未来值得期待,AI正越来越接近于人类的真实思维方式。

宝玉

96,619 просмотров • 1 год назад

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 просмотров • 2 лет назад