Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

“遥遥遥……遥领先” 6月12日,华为开发者大会 HDC 2026 在东莞举行。 余承东在会上谈到盘古大模型,称华为早年发布盘古时,“全中国、全世界都不知道大模型为何物”,华为可以说是行业“绝对的全球先驱者”,但后来因为各种原因“没做好”。 余承东还表示,去年国庆节前夕公司让他重新负责大模型,他会带领团队“一路赶超”,并称“在我余承东的字典里只有第一,没有第二”,要从“中国第一”走向“世界第一”。 有博主随后质疑这一说法,认为余承东的表述“说对也对,但确实又不完全是对的”。 博主指出,盘古大模型最早发布于 2021 年,确实早于 ChatGPT 上线,但当时“大模型”概念与今天的大模型并不完全相同; 同时 GPT-3 在此前已在技术行业内出名,因此不能说“全世界都不知道大模型为何物”。 该博主认为,华为在盘古上确实入场较早,但余承东的说法有“装逼”“别装过头了”的成分。

1,048,237 Aufrufe • vor 2 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

年前多关注ai板块吧 中国人参与多的就会有买单!就会有市场🤟 中国开源模型下载量首超美国,一场新的科技竞速正式打响! 还在觉得全球 AI 只看硅谷? MIT × Hugging Face 最新联合报告告诉你: 过去一年,全球开源 AI 模型下载量中,中国占比 17% —— 首次超过美国的 15.8%。 这不是一个小数点的变化,这是 AI 格局的一声惊雷。 意味着一个事实正在出现: 中国 AI,不再只是“追赶者”,而是实实在在的“生态领跑者”。 一、为什么这个数据爆炸性这么强? 开源模型下载量,是 AI 世界最真实的“民意投票”。 谁被用、谁被复用、谁被拿去做产品,下载量不会说谎。 它比论文数量更接地气,比发布会更诚实,比概念 PPT 更真实。 下载量高 = 模型真的“好使”“好用”“好落地”。 而这一回,中国冲到第一名,意味着什么? 全球开发者正在越来越多地选择中国模型。 中国模型正在成为国际生态的一部分,而不是“区域性产品”。 中国的 AI 创新正在进入全球循环,而非单向输入。 一句话: 中国不只在做模型,而是在影响世界开发者。 二、为什么中国能“后来居上”?三大原因让人无法忽视 ① 模型数量爆发式增长:百花齐放,开发者用不过来 过去一年,中国的开源模型生态堪称“井喷式”增长: 中小模型、大模型、多模态、语音、图像…… 能开的都开了,能放的都放了。 数量足够大,就能吸引足够多的开发者。 ② 性价比 + 轻量化:世界都在找中国模型“省钱神器” 不是每个团队都训练得起千亿级大模型。 但每个团队都想部署一个能跑的模型。 而中国模型的特质就是四个字: 轻、快、省、能打。 全球开发者当然爱。 ③ 中文生态的辐射效应:从东亚扩散到整个亚洲 中文模型强,意味着东亚、东南亚用户都能直接受益。 更大的人群、更高的需求,带来了更快的下载增长 三、美国依然很强,但“唯一主导”时代正在改变 必须说,美国仍然拥有: 世界最顶级的基础研究 算力、芯片、科研体系的深度优势 OpenAI / Google / Meta 等头部力量 但这一次的反超给了全球一个清晰的信号: AI 生态不再是“一家独大”。 多极化时代正在加速到来。 全球开发者的选择,正在慢慢从“硅谷中心论”转向“多中心协作”。 四、全球 AI 正进入“群雄争霸”时代 这次排名变化背后,是全球 AI 赛道进入全新阶段的标志: ① 从“技术竞赛”升级为“生态竞赛” 谁的模型被更多人用,谁就占据未来话语权。 ② 开源力量影响全球,而中国是关键节点 中国模型从“区域下载”变成“全球下载”,这是过去没有出现过的格局。 ③ 创新不再只来自单一地区 AI 正在走向: 中国能打、美国能打、欧洲能打、世界都能打。 这种竞争更健康,也更刺激。 五、结语:这不是终点,而是 AI 全球化的真正开始 中国开源模型首次登顶,并不是“谁碾压谁”的故事。 它真正意味着: 全球 AI,正在进入一个更开放、更多样、更具创造力的新纪元。 当中国模型被全球开发者下载、复用、再创造 这才是 AI 生态最值得期待的未来。

加密大师兄

22,361 Aufrufe • vor 9 Monaten

OpenAI 创始人 John Schulman 访谈节选:为什么 GPT-4 比一年前更“聪明”了?主要都是后训练(Post-Training)带来的! 另外他认为,在强化学习研究领域,研究人员需要具备丰富的经验和敏锐的直觉。了解整个技术堆栈,并对各个部分充满好奇心是关键。此外,从第一性原理出发思考问题,而不仅仅依靠实验证据,也能够帮助研究人员在数据操控和环境设置方面做出更好的决策。 *** Dwarkesh Patel:在未来,用于训练的计算力中,预训练与后训练的比例是否会明显偏向后训练呢? John Schulman:确实,有一些观点支持这种说法。 Dwarkesh Patel:我是说,现在这个比例非常不平衡。 John Schulman:但你可以认为,模型生成的输出质量比网上的大多数内容都要高。因此,让模型自己思考似乎更有道理,而不仅仅是训练来模仿网络上的内容。所以,我认为从第一性原理上来说,这是有说服力的。我会说,我们通过后训练取得了很多进步。因此,我不确定。所以,我希望我们会继续推动这种方法,并且可能会增加投入到后训练中的计算力。 Dwarkesh Patel:当前的 GPT-4 的 ELO 分数比最初发布的版本高出了大约 100 分。这是否全都是后训练带来的改进呢? John Schulman:对,我会说大部分都是后训练带来的。 Dwarkesh Patel:这很有意思。 John Schulman:因此,有很多不同的改进方向。我们会考虑数据质量,数据数量,进行更多的部署和收集新数据的迭代,改变你收集的注解种类。因此,有很多因素叠加在一起。但是全部加在一起,就会带来一个相当不错的,有效的计算力提升。 Dwarkesh Patel:后训练的优化程度对于竞争优势有多大影响呢? John Schulman:目前,我会区别公司是通过我们的模型有多大等等。那么,找出你之前提到的所有这些数据的复杂问题的公司,会占据大优势吗? John Schulman:我认为这确实是一个优势,因为这是一个非常复杂的任务。因此,你必须有很多有技能的人来执行它。因此,存在大量的隐性知识。同时也需要大量的组织知识。我认为后训练的过程,创建一个具备人们所关心的所有功能的模型,是十分复杂的。这需要付出大量的努力,它是大量研发工作的积累。我会说这种情况在某种程度上形成了一种壁垒,要想立即启动这种模型并非易事。 Dwarkesh Patel:看起来那些正在进行最严肃的预训练努力的公司,也在进行严肃的后训练努力。因此,看起来这种模型有可能被复制或有更多的类似努力出现。 John Schulman:另外,还有一种情况使得这个壁垒并非那么明显,那就是你可以提取模型,或者复制别人的模型输出,或者使用别人的模型进行比较。我认为大公司可能并不会这样做,因为这违反了服务条款,也会损害他们的自尊心,但我预计一些规模较小的参与者可能正在这样做以便更好地起步。 Dwarkesh Patel:那些真正擅长进行这种强化学习(RL)研究的人有什么样的特质呢?我听说这种研究非常具有挑战性,但是什么样的直觉能帮助你找到操控数据和设置环境的方法呢? John Schulman:我觉得有相当多的经验是关键。自从研究生时期以来,我一直在研究 RL 算法,涉及到数据收集、到注释过程,再到与语言模型的交互。所以,我算是涉猎了这些领域。我认为,在这类研究中表现出色的人通常对整个技术堆栈有全面的了解,并且对其中的各个部分充满好奇心。他们不仅依靠实验证据来更新自己的观点,还会从第一性原理出发思考问题。比如,假设深度学习是有效的,那么理想的收集数据的类型应该是什么,等等。

宝玉

57,175 Aufrufe • vor 2 Jahren