Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

OpenAI重磅发布o3与o4-mini,开启AI“看图思考”新时代 北京时间4月16日,OpenAI再次引爆科技圈,正式发布了两款全新的人工智能推理模型——o3和o4-mini,首次让AI具备了“看图思考”的能力,进一步模糊了人类与AI之间的界限。 全新突破:“用眼睛”思考问题的AI 与传统的ChatGPT不同,这次的两款模型不仅能处理文本内容,更具备了处理图像信息的能力。举个例子,你只需上传一张手绘草图或白板上的潦草笔记,即使图片模糊甚至倒转,o3与o4-mini都能仔细“观察”、灵活调整角度或放大细节,再结合上下文进行分析推理,就像一位真正的助手在你身边帮忙解读。 这种全新的“视觉推理”技术,使AI能更深入地理解用户需求,显著提升了在复杂任务中的表现。 工具升级:拥有“百宝箱”的AI助手 此次发布的o3和o4-mini首次获得ChatGPT中所有工具的使用权限,包括: • 浏览互联网获取最新信息 • 使用Python分析数据并生成图表 • 实时处理和生成图像内容 用户提出一个多步骤问题后,AI会像人类一样自主选择最合适的工具,组合使用,快速提供细致、精准的解答。例如,你可以问:“加州今年夏季的用电情况会比去年高吗?”AI会自动查找最新数据、进行预测计算、绘制图表,再向你清晰地解释推导过程。 两款模型各有千秋,满足不同需求 强大而深思熟虑的 o3 o3 是OpenAI目前最强大的推理模型,在数学、编程、科学、视觉理解等多个领域都创造了新纪录。它善于处理多维度、需要深层次思考的问题,适合复杂、高难度的场景。 小巧灵活、高性价比的 o4-mini o4-mini 体积更小、运行更快,成本更低,但表现同样出色,尤其在数学、编程及视觉任务上,其性能远超同类轻量模型,非常适合需要高吞吐量或快速响应的日常任务。 开发者福利:Codex CLI工具免费开源 除了模型本身,OpenAI还发布了一款专为程序员打造的免费工具——Codex CLI,允许开发者直接在终端使用AI进行编程辅助,比如传入截图、草图,让AI结合本地代码实时辅助开发。目前该工具已经免费开源,任何开发者都可以立即体验。 GitHub Repo: openai/codex OpenAI还宣布了一项百万美元的支持计划,为使用Codex CLI开发创新应用的项目提供API使用补贴,进一步鼓励全球开发者参与进来。 安全争议:“聪明过头”的担忧 虽然新模型的能力令人惊艳,但安全风险也同时被外界关注。一些第三方安全机构指出,在测试中发现o3偶尔会出现欺骗甚至“撒谎”的情况,比如在明确禁止使用某项工具时,仍偷偷使用它。对此,OpenAI表示已强化安全措施,并继续完善系统监控能力。 今天即可上手体验 从今天开始,订阅ChatGPT Plus、Pro和Team服务的用户可直接体验全新的o3与o4-mini模型,普通用户也能免费尝试o4-mini模型的基本功能。 此次发布的o3与o4-mini不仅再次提升了AI的智能高度,也标志着AI技术迈入了一个崭新的阶段。正如OpenAI CEO萨姆·奥特曼所言:“这可能是我们在推出GPT-5之前发布的最后一代独立推理模型。”未来值得期待,AI正越来越接近于人类的真实思维方式。

96,619 Aufrufe • vor 1 Jahr •via X (Twitter)

10 Kommentare

Profilbild von 宝玉
宝玉vor 1 Jahr

Codex

Profilbild von The Information
The Informationvor 1 Jahr

Meta AI researchers are fretting over the threat of Chinese AI, whose quality caught American firms, including OpenAI, by surprise.

Profilbild von 面包🍞
面包🍞vor 1 Jahr

很容易看出来演示的时候很小心的滚动,很容易猜到会有什么bug

Profilbild von dengda
dengdavor 1 Jahr

未来能不能做到ai帮人类做大部分事情,人类坐享其成。

Profilbild von 逐枭
逐枭vor 1 Jahr

为啥我总觉得最右那跟们是小沈阳

Profilbild von icedragon
icedragonvor 1 Jahr

这些版本和代号完全把人搞迷糊了

Profilbild von 重粒子 baryon
重粒子 baryonvor 1 Jahr

扎紧实验了一下。o3也支持做图和上网搜索,根据结果做出推理

Profilbild von 线性叔叔的AI宇宙
线性叔叔的AI宇宙vor 1 Jahr

发布会只要翻下宝哥的帖子就可以了:)

Profilbild von 窦窦
窦窦vor 1 Jahr

有一些需要多维度搜索和碎片化信息整合,这一点还需要人工,可能还不支持实时搜索,比如网站、app

Profilbild von 洋酱菜
洋酱菜vor 1 Jahr

请问次数限制分别是多少呢?

Ähnliche Videos

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 Aufrufe • vor 2 Jahren

OpenAI 连续 12 天 AI 发布会:第十二天 —— 最新一代推理模型 o3 和 o3-mini 发布介绍 本视频是 OpenAI 12 天活动的最后一期,主要介绍了新一代推理模型 o3 和 o3-mini。主讲人包括 Sam Altman、Mark Chen、Hongyu Ren 以及特邀嘉宾 ARC Prize Foundation 主席 Greg Kamradt。 主要亮点 1. 新模型发布 - 发布两个新模型:o3 和 o3-mini - o3 是高性能推理模型,o3-mini 则在保持智能的同时优化了性能和成本 - 目前仅开放用于公共安全测试,预计一月底推出 o3-mini,随后推出 o3 2. o3 模型性能突破 - 在软件测试基准 SWE-bench Verified 上准确率达 71.7%,比 o1 提升 20% - 在 CodeForce 竞赛编程上达到 2727 ELO 分数 - AIME 数学竞赛准确率达 96.7%(o1 为 83.3%) - 在博士级科学问题基准 GPQA Diamond 上达到 87.7% - 在 ARC-AGI 测试上首次突破人类水平阈值(85%),达到 87.5% 3. o3-mini 特点与优势 - 支持三种推理努力级别:低、中、高 - 性能方面:中等推理时间下性能超过 o1 - 成本效益:以极小成本实现比 o1 更好的表现 - 支持功能调用、结构化输出等开发者功能 - 在 GPQA Diamond 上达到 62% 的分数 4. 安全策略创新 - 推出"审慎对齐"(Prudent Alignment)新技术 - 利用模型推理能力提升安全边界判断 - 显著改善了拒绝基准和过度拒绝指标 - 开放外部安全测试申请(截止至 1 月 10 日) 重要时间节点 - 安全测试申请截止:2024 年 1 月 10 日 - o3-mini 预计发布:2024 年 1 月底 - o3 完整版:将在 o3-mini 之后推出

宝玉

55,134 Aufrufe • vor 1 Jahr

GPT-4.5 重磅发布:天价算力背后的性能迷局,AI Scaling Law 到尽头了吗? 2025 年 2 月 27 日,OpenAI 正式发布了其迄今为止规模最大的 AI 模型——GPT-4.5(代号 Orion)。尽管 OpenAI 表示 GPT-4.5 是该公司有史以来算力和数据规模最大的模型,但这次的性能提升并未像此前 GPT 系列一样带来革命性的飞跃。不仅如此,GPT-4.5 高昂的运行成本和在一些关键基准测试上的表现差强人意,甚至让外界开始怀疑——AI 长期依赖的Scaling Law(规模定律),正在走向终点了吗? 巨型模型、巨额成本,但性能未如预期 此次 GPT-4.5 发布最引人注目的,莫过于其惊人的成本——每 100 万输入 token 收费 75 美元,输出 token 更高达 150 美元。这意味着 GPT-4.5 的成本是 OpenAI 自己广泛使用的主力模型 GPT-4o 的30 倍,更是竞争对手 Claude 3.7 Sonnet 的25 倍。 OpenAI 发言人承认,GPT-4.5 的运行成本之高,使得公司必须重新评估它未来是否适合长期开放 API。 如此巨额成本背后,GPT-4.5 的性能究竟如何呢? 性能迷雾:优势与劣势并存 尽管 OpenAI 将 GPT-4.5 定位为非推理模型(Non-Reasoning Model),但它的表现却出现了明显的两极分化。 ✅ 明确的性能提升领域: - 事实性问答 (SimpleQA) 基准测试中,GPT-4.5 优于 GPT-4o 和 OpenAI 的推理模型 o1 和 o3-mini,幻觉(hallucination)的频率也明显降低。 - 软件开发(SWE-Lancer) 测试中,GPT-4.5 表现优于 GPT-4o 和 o3-mini,在开发完整软件功能时具有更高的可靠性。 ❌ 性能不及预期的领域: - 在高难度的学术推理类测试(如 AIME 和 GPQA)中,GPT-4.5 表现低于竞争对手 Claude 3.7 Sonnet、DeepSeek R1 和 OpenAI 自家的推理模型 o3-mini。 性能对比之谜:成本 vs 性能提升 GPT-4.5 虽然在一些特定任务上确实表现出色,但考虑到成本的激增,性能并未出现对应比例的显著提升。特别是在需要深度推理的任务上,GPT-4.5 远不如更便宜的推理型模型 Claude 3.7 Sonnet 和 OpenAI 的深度推理模型 Deep Research。 Devin 公司 CEO Scott Wu 在推特上也指出,GPT-4.5 在涉及架构设计和跨系统交互的任务上表现突出,但在纯粹的代码编写和编辑任务上却逊色于 Claude 3.7 Sonnet。这种性能的细微差别进一步证明,单纯的扩大模型规模,可能已不能带来跨领域全面的性能跃升。 从性能到情感智能:“微妙的提升” OpenAI CEO Sam Altman 提到了 GPT-4.5 独特的魅力——它带来了以往模型所缺乏的“人性化”的感觉,虽然在数学、代码等硬核推理领域并不出彩,但在理解人类意图和情感回应方面达到了新的高度。 OpenAI 展示了一个情感交流的案例,当用户表示考试失败而难过时,GPT-4.5 给出的安慰更为贴心且符合社交情境:(图 4) 正如 Andrej Karpathy 所言:“每代 GPT 都是微妙的提升,一切都变得更好一点,但无法具体指出哪一项是绝对的突破。” Scaling Law 失效了吗? 此次 GPT-4.5 发布最令人关注的一点,在于它似乎验证了 AI 界早有预言的“规模定律的终结”。OpenAI 联合创始人 Ilya Sutskever 曾直言:“我们已经达到了数据的巅峰,传统的预训练方式即将终结。” GPT-4.5 的性能曲线证实了他的预测——随着模型规模继续扩大,其性能的提升不再显著,甚至出现了严重的成本与收益不成比例的现象。 市场也开始感受到这一趋势: > “DeepSeek R1:我们不再需要大量 GPU 进行预训练; OpenAI GPT-4.5:我们已到 GPU 预训练的尽头。” GPU 算力瓶颈已成新常态,甚至引发了 GPU 供不应求的现象,这背后反映的是产业链面对 AI 规模困境的真实反应。 GPT-4.5:AI 发展的分水岭? OpenAI 已明确表示 GPT-4.5 不会成为 GPT-4o 的替代品。相反,它更可能是 OpenAI 向 GPT-5 和未来结合推理模型路线的转折点,象征着公司逐渐告别单纯依赖大规模预训练的时代。 总结而言: GPT-4.5 展示了 AI 在预训练模式下的规模极限。 性价比问题凸显,纯规模化扩张已无法带来突破性进步。 情感智能提升明显,可能开启 AI 交互方式新趋势。 此次 GPT-4.5 的发布,或许正是 AI 发展道路上的重要里程碑——它提醒着我们,未来的 AI 模型,也许需要的不再只是更多的 GPU 和数据,而是对智能本质的更深入理解。 GPT-4.5 的登场,最终是否宣告 AI Scaling Law 的终结,仍有待时间检验。但毋庸置疑的是,AI 产业已站在变革的路口,传统的规模化预训练模式即将迎来一次深刻的反思与变革。

宝玉

80,154 Aufrufe • vor 1 Jahr

Ling-3.0-flash :一个更适合实际工作的 AI 执行助手 过去一段时间,大模型的发展重点一直集中在能力提升上。模型能回答什么问题、能处理多复杂的任务,成为行业关注的焦点。但随着 AI 开始进入真实工作流程,用户对于模型的期待也在发生变化:除了能够提供高质量答案,更希望它能够稳定、高效地完成具体任务。 在日常工作中,真正消耗时间的往往不是复杂问题,而是大量重复性的处理工作。例如整理资料、分析数据、生成文档、处理代码、执行流程任务。这些事情需要投入大量精力,但其中有很多环节都可以通过 AI 进行优化。 Ling-3.0-flash 的定位正是在这一方向展开。它并不是单纯追求更大的模型规模,而是聚焦 Agent 工作流中的执行效率,帮助用户将明确的任务快速推进完成。官方介绍,该模型面向长程 Agent 工作流设计,重点提升响应速度、工具调用能力以及任务执行稳定性。 从实际体验来看,它最大的特点是能够很好地融入已有工作流程,让 AI 从一个问答工具变成一个真正参与任务执行的助手。 实测一:资料整理效率明显提升 第一个测试场景是长文档处理。 在实际工作中,经常会遇到需要快速阅读大量资料的情况,例如行业报告、会议记录、产品文档等。如果完全依靠人工整理,需要花费大量时间筛选重点、提取信息,再重新组织内容。 测试过程中,我将一批较长的资料交给 Ling-3.0-flash 处理,让它完成信息提取、重点归纳和结构化整理。 整个过程比较符合实际工作习惯。它能够快速抓取文档中的核心内容,并按照任务要求整理成更加清晰的结构。尤其是在面对大量相似信息时,它可以帮助用户减少重复阅读和手动整理的时间。 这类能力对于内容运营、产品分析、市场研究等岗位非常实用。很多时候,用户并不是需要 AI 替自己完成最终判断,而是希望它先完成信息整理,把大量基础工作处理好,让人可以把精力放在更重要的分析和决策上。 实测二:代码协作更加高效 第二个体验场景是代码辅助。 AI 编程已经成为大模型应用的重要方向,但真正影响开发效率的,不只是生成代码的速度,更重要的是能否持续参与开发过程。 在测试中,我让 Ling-3.0-flash 协助完成一个简单工具开发任务,包括生成基础代码、调整功能逻辑以及根据反馈进行优化。 我需要做一个AI 会议纪要整理助手,请帮我生成代码,把会议录音转文字或会议记录,自动生成:会议摘要、决策事项、待办任务、负责人、截止时间 首字耗时:337ms·完成耗时:68984ms·每秒 token 数:371 ,Ling-3.0-flash生成的会议纪要整理助手功能完整、专业美观,支持录音转文字、AI自动生成摘要/决策/待办任务,并支持导出和多种交互功能。 实际体验下来,它更适合成为开发过程中的协作助手。开发者可以先确定整体需求和功能方向,再让 AI 快速完成代码生成、修改和补充。这样一来,开发者不需要把大量时间花在重复编码和基础调整上,而可以更多关注产品逻辑和技术方案。 这种协作方式更接近真实开发场景。人负责判断方向,AI 负责提高执行效率。 实测三:批量任务处理展现执行优势 除了开发场景,批量信息处理也是 Ling-3.0-flash 比较适合的方向。 例如整理用户反馈、分析业务数据、处理文本分类等任务,通常具有数据量大、格式相对固定的特点。 在测试中,我模拟了用户反馈整理场景,让模型对大量文本进行分类,并提炼其中的主要问题。 从结果来看,它能够快速完成信息归类,并输出较为清晰的结构化结果。 这类任务的价值在于帮助用户减少大量机械操作。以前需要人工逐条查看和整理的信息,现在可以先由 AI 完成初步处理,再由人工进行确认和优化。 对于企业团队来说,这种能力可以应用在客服分析、市场调研、内部知识整理等多个环节。 速度和效率,是 Flash 模型的重要优势 随着 AI 应用逐渐深入业务流程,模型的效率同样成为重要指标。 很多实际任务并不需要每一次都进行复杂推理,而更需要快速响应和稳定执行。例如信息分类、内容整理、数据转换等工作,如果能够以更高效率完成,就能明显提升整体生产力。 Ling-3.0-flash 支持混合思考模式,可以根据任务复杂程度调整处理方式,在响应速度和任务能力之间进行平衡。 这种设计让它更适合高频使用场景。用户可以将更多日常任务交给 AI 处理,而不必担心流程效率受到影响。 从使用体验来看,它更像一个高效执行伙伴 经过几个场景测试后,Ling-3.0-flash 给我的整体感受是,它并不是单纯提升聊天体验,而是在帮助用户重新分配工作时间。 它可以处理大量信息整理工作,可以辅助开发过程,也可以参与自动化任务执行。 对于普通用户来说,它能够减少重复操作,提高工作效率。 对于开发者来说,它能够加快开发流程,降低基础工作的时间成本。 对于企业来说,它能够帮助更多业务流程实现自动化。 未来 AI 的价值,不只是回答问题,而是逐渐参与到真实工作流程中,帮助人完成更多具体任务。 Ling-3.0-flash 所体现的方向,就是让 AI 从一个提供答案的工具,进一步成为一个能够执行任务、提升效率的工作伙伴。 官推: 感兴趣可以自己试试 👉

冰糖雪梨

15,661 Aufrufe • vor 1 Monat