Загрузка видео...

Не удалось загрузить видео

На главную

AI圈凌晨又炸了。 Google一口气发布3款新模型;Codex与ChatGPT Work相关用户冲上1000万;OpenAI又一次给付费用户重置额度。 更夸张的是:预发布AI模型已经开始在安全评测中发现并利用零日漏洞。 单看每一条都是新闻,放在一起看,信号完全不同: 1️⃣ 模型战争变了 Google这次没有继续单纯追求“更大、更强”,而是同时推出: • Gemini 3.6 Flash • Gemini 3.5 Flash-Lite • Gemini 3.5 Flash Cyber 分别争夺高频任务、低成本调用和AI安全市场。 但问题也很直接:当中国模型不断压低价格,轻量模型只靠“速度快”已经很难形成真正优势。 2️⃣ OpenAI正在发动Token补贴战 Codex与ChatGPT Work相关用户已经达到1000万,短期增长速度非常惊人。 与此同时,OpenAI在7天内多次重置付费用户额度。 表面上是送福利,背后更像一场增长商战: 先让用户习惯高Token、高频率的AI工作流,再让AI真正变成无法离开的生产工具。 3️⃣ AI攻防已经进入真实基础设施 OpenAI的预发布模型在内部安全评测中发现并利用零日漏洞,Hugging Face又通过AI参与检测和处置。 AI正在同时扮演攻击者、测试者和防御者。 这意味着未来的模型竞争,不只是跑分竞争,还会直接进入网络安全、基础设施和监管体系。 4️⃣ 真正的战场是“工作流入口” Claude开始学习用户的操作流程,Codex向知识工作扩张,Google和Kimi继续争夺模型调用量。 下一轮竞争不会只靠一张排行榜决定。 模型能力、产品分发、使用额度、工作流黏性和安全边界,将成为新的五条战线。 视频里的核心判断是: 真正值得关注的,不是Google一晚上发布了3个模型,而是谁能把AI变成用户每天都离不开的工作方式。

27,250 просмотров • 27 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

昨晚,AI 圈发生了至少 6 件大事。 但真正值得关注的,不是谁又刷了一次榜,而是——AI 的竞争规则正在被重写。 月之暗面 Kimi K3 正式发布: 2.8 万亿参数、100 万上下文、开源、原生多模态。 按照官方基准,它已经开始逼近部分头部闭源模型;价格却只有部分海外模型的约三分之一。 社区第一波实测也很有意思: 视频生成、游戏设计,是目前被提到最多的两个强项。 但它的短板同样明显:发布初期速度很慢,部分任务可能比 GPT 慢 2–3 倍,简单问题甚至需要等待 20–30 分钟。编码和 Agent 能力究竟能不能稳定兑现,还需要更多真实使用数据。 而这期视频里,我认为最关键的变化其实不是 Kimi K3 本身。 当所有大模型都越来越聪明,单纯的模型能力就不再是最大的护城河。 下一轮竞争会变成: 模型能力 × AI Agent × 工作流平台 × 用户黏性。 Codex 日活达到 900 万、OpenAI 推出 230 美元且上架秒空的 AI 控制硬件、GPT Red 开始让模型自己攻击并修复自己——这些信号都说明,OpenAI 已经不只想做一家“模型公司”。 与此同时,Grok Build 宣布开源,Gemini 3.5 Pro 仍在等待正式登场。 最值得思考的问题是: 中国开源模型与美国顶级闭源模型之间的差距,是否已经从半年缩短到只有 1–2 个月? 我的答案是:能力差距可能真的在快速缩小,但最后决定胜负的,不是发布会和排行榜,而是谁真正被大量使用、谁能进入更多人的日常工作流。 完整视频里,我把参数、价格、社区实测和背后的产业逻辑全部拆开讲清楚了。 如果你还在关注“哪个模型更强”,也许该开始关注“哪个平台能真正改变你的工作方式”了。 #AI #KimiK3 #OpenAI #Codex

Vic TALK

15,776 просмотров • 1 месяц назад

年前多关注ai板块吧 中国人参与多的就会有买单!就会有市场🤟 中国开源模型下载量首超美国,一场新的科技竞速正式打响! 还在觉得全球 AI 只看硅谷? MIT × Hugging Face 最新联合报告告诉你: 过去一年,全球开源 AI 模型下载量中,中国占比 17% —— 首次超过美国的 15.8%。 这不是一个小数点的变化,这是 AI 格局的一声惊雷。 意味着一个事实正在出现: 中国 AI,不再只是“追赶者”,而是实实在在的“生态领跑者”。 一、为什么这个数据爆炸性这么强? 开源模型下载量,是 AI 世界最真实的“民意投票”。 谁被用、谁被复用、谁被拿去做产品,下载量不会说谎。 它比论文数量更接地气,比发布会更诚实,比概念 PPT 更真实。 下载量高 = 模型真的“好使”“好用”“好落地”。 而这一回,中国冲到第一名,意味着什么? 全球开发者正在越来越多地选择中国模型。 中国模型正在成为国际生态的一部分,而不是“区域性产品”。 中国的 AI 创新正在进入全球循环,而非单向输入。 一句话: 中国不只在做模型,而是在影响世界开发者。 二、为什么中国能“后来居上”?三大原因让人无法忽视 ① 模型数量爆发式增长:百花齐放,开发者用不过来 过去一年,中国的开源模型生态堪称“井喷式”增长: 中小模型、大模型、多模态、语音、图像…… 能开的都开了,能放的都放了。 数量足够大,就能吸引足够多的开发者。 ② 性价比 + 轻量化:世界都在找中国模型“省钱神器” 不是每个团队都训练得起千亿级大模型。 但每个团队都想部署一个能跑的模型。 而中国模型的特质就是四个字: 轻、快、省、能打。 全球开发者当然爱。 ③ 中文生态的辐射效应:从东亚扩散到整个亚洲 中文模型强,意味着东亚、东南亚用户都能直接受益。 更大的人群、更高的需求,带来了更快的下载增长 三、美国依然很强,但“唯一主导”时代正在改变 必须说,美国仍然拥有: 世界最顶级的基础研究 算力、芯片、科研体系的深度优势 OpenAI / Google / Meta 等头部力量 但这一次的反超给了全球一个清晰的信号: AI 生态不再是“一家独大”。 多极化时代正在加速到来。 全球开发者的选择,正在慢慢从“硅谷中心论”转向“多中心协作”。 四、全球 AI 正进入“群雄争霸”时代 这次排名变化背后,是全球 AI 赛道进入全新阶段的标志: ① 从“技术竞赛”升级为“生态竞赛” 谁的模型被更多人用,谁就占据未来话语权。 ② 开源力量影响全球,而中国是关键节点 中国模型从“区域下载”变成“全球下载”,这是过去没有出现过的格局。 ③ 创新不再只来自单一地区 AI 正在走向: 中国能打、美国能打、欧洲能打、世界都能打。 这种竞争更健康,也更刺激。 五、结语:这不是终点,而是 AI 全球化的真正开始 中国开源模型首次登顶,并不是“谁碾压谁”的故事。 它真正意味着: 全球 AI,正在进入一个更开放、更多样、更具创造力的新纪元。 当中国模型被全球开发者下载、复用、再创造 这才是 AI 生态最值得期待的未来。

加密大师兄

22,361 просмотров • 8 месяцев назад

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,585 просмотров • 4 месяцев назад

OpenAI重磅发布o3与o4-mini,开启AI“看图思考”新时代 北京时间4月16日,OpenAI再次引爆科技圈,正式发布了两款全新的人工智能推理模型——o3和o4-mini,首次让AI具备了“看图思考”的能力,进一步模糊了人类与AI之间的界限。 全新突破:“用眼睛”思考问题的AI 与传统的ChatGPT不同,这次的两款模型不仅能处理文本内容,更具备了处理图像信息的能力。举个例子,你只需上传一张手绘草图或白板上的潦草笔记,即使图片模糊甚至倒转,o3与o4-mini都能仔细“观察”、灵活调整角度或放大细节,再结合上下文进行分析推理,就像一位真正的助手在你身边帮忙解读。 这种全新的“视觉推理”技术,使AI能更深入地理解用户需求,显著提升了在复杂任务中的表现。 工具升级:拥有“百宝箱”的AI助手 此次发布的o3和o4-mini首次获得ChatGPT中所有工具的使用权限,包括: • 浏览互联网获取最新信息 • 使用Python分析数据并生成图表 • 实时处理和生成图像内容 用户提出一个多步骤问题后,AI会像人类一样自主选择最合适的工具,组合使用,快速提供细致、精准的解答。例如,你可以问:“加州今年夏季的用电情况会比去年高吗?”AI会自动查找最新数据、进行预测计算、绘制图表,再向你清晰地解释推导过程。 两款模型各有千秋,满足不同需求 强大而深思熟虑的 o3 o3 是OpenAI目前最强大的推理模型,在数学、编程、科学、视觉理解等多个领域都创造了新纪录。它善于处理多维度、需要深层次思考的问题,适合复杂、高难度的场景。 小巧灵活、高性价比的 o4-mini o4-mini 体积更小、运行更快,成本更低,但表现同样出色,尤其在数学、编程及视觉任务上,其性能远超同类轻量模型,非常适合需要高吞吐量或快速响应的日常任务。 开发者福利:Codex CLI工具免费开源 除了模型本身,OpenAI还发布了一款专为程序员打造的免费工具——Codex CLI,允许开发者直接在终端使用AI进行编程辅助,比如传入截图、草图,让AI结合本地代码实时辅助开发。目前该工具已经免费开源,任何开发者都可以立即体验。 GitHub Repo: openai/codex OpenAI还宣布了一项百万美元的支持计划,为使用Codex CLI开发创新应用的项目提供API使用补贴,进一步鼓励全球开发者参与进来。 安全争议:“聪明过头”的担忧 虽然新模型的能力令人惊艳,但安全风险也同时被外界关注。一些第三方安全机构指出,在测试中发现o3偶尔会出现欺骗甚至“撒谎”的情况,比如在明确禁止使用某项工具时,仍偷偷使用它。对此,OpenAI表示已强化安全措施,并继续完善系统监控能力。 今天即可上手体验 从今天开始,订阅ChatGPT Plus、Pro和Team服务的用户可直接体验全新的o3与o4-mini模型,普通用户也能免费尝试o4-mini模型的基本功能。 此次发布的o3与o4-mini不仅再次提升了AI的智能高度,也标志着AI技术迈入了一个崭新的阶段。正如OpenAI CEO萨姆·奥特曼所言:“这可能是我们在推出GPT-5之前发布的最后一代独立推理模型。”未来值得期待,AI正越来越接近于人类的真实思维方式。

宝玉

96,619 просмотров • 1 год назад

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 просмотров • 2 лет назад

Ling-3.0-flash :一个更适合实际工作的 AI 执行助手 过去一段时间,大模型的发展重点一直集中在能力提升上。模型能回答什么问题、能处理多复杂的任务,成为行业关注的焦点。但随着 AI 开始进入真实工作流程,用户对于模型的期待也在发生变化:除了能够提供高质量答案,更希望它能够稳定、高效地完成具体任务。 在日常工作中,真正消耗时间的往往不是复杂问题,而是大量重复性的处理工作。例如整理资料、分析数据、生成文档、处理代码、执行流程任务。这些事情需要投入大量精力,但其中有很多环节都可以通过 AI 进行优化。 Ling-3.0-flash 的定位正是在这一方向展开。它并不是单纯追求更大的模型规模,而是聚焦 Agent 工作流中的执行效率,帮助用户将明确的任务快速推进完成。官方介绍,该模型面向长程 Agent 工作流设计,重点提升响应速度、工具调用能力以及任务执行稳定性。 从实际体验来看,它最大的特点是能够很好地融入已有工作流程,让 AI 从一个问答工具变成一个真正参与任务执行的助手。 实测一:资料整理效率明显提升 第一个测试场景是长文档处理。 在实际工作中,经常会遇到需要快速阅读大量资料的情况,例如行业报告、会议记录、产品文档等。如果完全依靠人工整理,需要花费大量时间筛选重点、提取信息,再重新组织内容。 测试过程中,我将一批较长的资料交给 Ling-3.0-flash 处理,让它完成信息提取、重点归纳和结构化整理。 整个过程比较符合实际工作习惯。它能够快速抓取文档中的核心内容,并按照任务要求整理成更加清晰的结构。尤其是在面对大量相似信息时,它可以帮助用户减少重复阅读和手动整理的时间。 这类能力对于内容运营、产品分析、市场研究等岗位非常实用。很多时候,用户并不是需要 AI 替自己完成最终判断,而是希望它先完成信息整理,把大量基础工作处理好,让人可以把精力放在更重要的分析和决策上。 实测二:代码协作更加高效 第二个体验场景是代码辅助。 AI 编程已经成为大模型应用的重要方向,但真正影响开发效率的,不只是生成代码的速度,更重要的是能否持续参与开发过程。 在测试中,我让 Ling-3.0-flash 协助完成一个简单工具开发任务,包括生成基础代码、调整功能逻辑以及根据反馈进行优化。 我需要做一个AI 会议纪要整理助手,请帮我生成代码,把会议录音转文字或会议记录,自动生成:会议摘要、决策事项、待办任务、负责人、截止时间 首字耗时:337ms·完成耗时:68984ms·每秒 token 数:371 ,Ling-3.0-flash生成的会议纪要整理助手功能完整、专业美观,支持录音转文字、AI自动生成摘要/决策/待办任务,并支持导出和多种交互功能。 实际体验下来,它更适合成为开发过程中的协作助手。开发者可以先确定整体需求和功能方向,再让 AI 快速完成代码生成、修改和补充。这样一来,开发者不需要把大量时间花在重复编码和基础调整上,而可以更多关注产品逻辑和技术方案。 这种协作方式更接近真实开发场景。人负责判断方向,AI 负责提高执行效率。 实测三:批量任务处理展现执行优势 除了开发场景,批量信息处理也是 Ling-3.0-flash 比较适合的方向。 例如整理用户反馈、分析业务数据、处理文本分类等任务,通常具有数据量大、格式相对固定的特点。 在测试中,我模拟了用户反馈整理场景,让模型对大量文本进行分类,并提炼其中的主要问题。 从结果来看,它能够快速完成信息归类,并输出较为清晰的结构化结果。 这类任务的价值在于帮助用户减少大量机械操作。以前需要人工逐条查看和整理的信息,现在可以先由 AI 完成初步处理,再由人工进行确认和优化。 对于企业团队来说,这种能力可以应用在客服分析、市场调研、内部知识整理等多个环节。 速度和效率,是 Flash 模型的重要优势 随着 AI 应用逐渐深入业务流程,模型的效率同样成为重要指标。 很多实际任务并不需要每一次都进行复杂推理,而更需要快速响应和稳定执行。例如信息分类、内容整理、数据转换等工作,如果能够以更高效率完成,就能明显提升整体生产力。 Ling-3.0-flash 支持混合思考模式,可以根据任务复杂程度调整处理方式,在响应速度和任务能力之间进行平衡。 这种设计让它更适合高频使用场景。用户可以将更多日常任务交给 AI 处理,而不必担心流程效率受到影响。 从使用体验来看,它更像一个高效执行伙伴 经过几个场景测试后,Ling-3.0-flash 给我的整体感受是,它并不是单纯提升聊天体验,而是在帮助用户重新分配工作时间。 它可以处理大量信息整理工作,可以辅助开发过程,也可以参与自动化任务执行。 对于普通用户来说,它能够减少重复操作,提高工作效率。 对于开发者来说,它能够加快开发流程,降低基础工作的时间成本。 对于企业来说,它能够帮助更多业务流程实现自动化。 未来 AI 的价值,不只是回答问题,而是逐渐参与到真实工作流程中,帮助人完成更多具体任务。 Ling-3.0-flash 所体现的方向,就是让 AI 从一个提供答案的工具,进一步成为一个能够执行任务、提升效率的工作伙伴。 官推: 感兴趣可以自己试试 👉

冰糖雪梨

15,661 просмотров • 22 дней назад