Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

AI会永远对你撒谎。 这不是bug,是数学定律。 我,卡内基梅隆大学的数学学生,用数学告诉你为什么。 所有语言模型,只做一件事: 根据它读过的所有资料,预测下一个最有可能的词。 但这里有个死结。 模型的猜测,我们叫它q(x)。 真实世界的概率,我们叫它p(x)。 q(x)永远不可能等于p(x)。 它们之间,永远有一道鸿沟。 有个数学公式,就是用来测量这道鸿沟的。 只要模型不能完美预测下一个词 它永远不能 那这个鸿沟就永远不会是零。 所以,当AI不知道真相的时候会发生什么? 它不能停机,它必须给你一个答案。 它只能硬着头皮,输出一个它认为“最像”答案的答案。 哪怕那是错的。 这就是“幻觉”。 一个基于不完整信息,却无比自信的猜测。 最要命的是,数学甚至给出了一个下限。 就算最完美的模型,它的幻觉率也永远不可能低于这个数字。 只要它不知道关于这个世界的一切 它永远不可能知道。 它就总会有概率,编造事实。 所以,无论AI变得多强大,它都会撒谎。 因为数学就是这么写的。

73,645 Aufrufe • vor 8 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

人工智能之父辛顿对他的杰作发出了令人不寒而栗的警告… 采访者: 人类知道自己在做什么吗? Hinton: 嗯,我认为我们正在进入一个时期,在这个时期,我们可能第一次拥有比我们更智能的东西。 采访者: 你相信它们能理解吗? Hinton: 是的。 采访者: 你相信它们是智能的吗? Hinton: 是的。 采访者: 你相信这些系统有自己的经历吗? Hinton: 是的。 采访者: 并且能基于那些经历做出决定吗? Hinton: 在与人类相同的意义上,是的。 采访者: 它们有意识吗? Hinton: 我认为它们目前可能没有多少自我意识。所以从这个意义上说,我不认为它们有意识。 采访者: 它们会有自我意识吗? Hinton: 哦,是的。 采访者: 是吗? Hinton: 哦,是的。所以想想看。这样一来,人类将成为地球上第二智能的生物。 Hinton: 我们对它大致在做什么有一个很好的了解。但一旦它变得真正复杂,我们就不再真正知道发生了什么,就像我们不知道你大脑里发生了什么一样。 采访者: 你说什么意思,我们不知道它到底是怎么工作的?它是由人设计的。 Hinton: 不,不是的。我们所做的是设计学习算法。这有点像设计进化的原理。但当这个学习算法与数据互动时,它会产生复杂的神经网络,这些网络擅长做某些事情,但我们并不真正理解它们到底是如何做到的。

KK.aWSB

54,245 Aufrufe • vor 8 Monaten

熟悉Prompt的同学们应该都知道,通常在写Prompt的时候要先设定角色:“你是XX方面的专家”,这并非玄学,而是有科学根据的。 GPT在训练的时候,有各种训练数据,有的质量高有的质量低,而默认情况下,生成高质量数据和低质量数据的概率差不多,但是当你给它设定XX专家的角色时,它会尽可能把概率分布在高质量的解决方案上。 详细内容建议看下面这段Andrej Karpathy在State of GPT中的一段演讲。 以下是这段视频的文字文字内容: ---------- 下面我要讲的这点对LLM的理解非常有趣,我觉得这算是LLM的一种心理特性:LLM并不追求成功,而是追求模仿。你希望它成功,那就需要向它明确要求。这里的意思是,在训练Transformer的过程中,它们有各种训练集,而这些训练数据中可能涵盖了各种不同质量的表现。比如,可能有一个关于物理问题的提示,然后可能有学生的解答完全错误,但也可能有专家的答案完全正确。尽管Transformer可以识别出低质量的解决方案和高质量的解决方案,但默认情况下,它们只会模仿所有的数据,因为它们仅仅是基于语言模型进行训练的。 在实际测试中,你其实需要明确要求它表现得好。在这篇论文的实验中,他们尝试了各种提示。例如,“让我们逐步思考”这种提示就很有效,因为它把推理过程分散到了许多记号上。但效果更好的是这样的提示:“让我们以一步一步的方式解决问题,以确保我们得到正确的答案。” 这就好像是在引导Transformer去得出正确的答案,这会使Transformer的表现更好,因为此时Transformer不再需要把它的概率质量分散到低质量的解决方案上,尽管这听起来很荒谬。 基本上,你可以自由地要求一个高质量的解决方案。比如,你可以告诉它,“你是这个话题的领先专家。假装你的智商是120。” 但不要尝试要求太高的智商,因为如果你要求智商400,可能就超出了数据分布的范围,更糟糕的是,你可能落入了类似科幻内容的数据分布,它可能会开始展现一些科幻的,或者说角色扮演类的东西。所以,你需要找到适合的智商要求。我想这可能是一个U型曲线的关系。

宝玉

348,735 Aufrufe • vor 3 Jahren

最近陶哲轩在 2024 年第 65 届国际数学奥林匹克上,陶哲轩做了一次 AI 和数学的演讲,非常精彩,从数学使用计算计算机的历史开始讲起,一直讲到大语言模型,干货相当多,尤其适合对数学有兴趣的同学。 (对数学没那么感兴趣的同学只想看 AI 部分的建议直接跳到 41 分的位置开始观看) 先摘录几个冷知识: 1. 我们使用机器做数学计算已经有数千年,最早的机器辅助计算可能是罗马人,然后是中国的算盘 2. 二战时就有人肉“计算机”,计算弹道和其他任务,多位女孩子,因为男士们在打仗,所以那时候的计算基本单位不是GPU,而是kilogirl-hour——“千名女孩工作一小时的计算量” 3. 现在,数学家们使用一种现代化的证明辅助编程语言,叫做 Lean。在 Lean 中有一个核心的数学库,通过众包的方式开发的,本科数学课程中看到的内容,比如微积分基础、群论基础或者拓扑学等等,这些都已经被形式化了,所以你不用从公理开始。 4. 现在数学领域有一种团队协作证明复杂数学定理的工作流程,那就是先编写一个称为“蓝图”的详细证明计划,将整个证明分解为数百个小步骤。每个步骤可以单独形式化,然后再将它们整合在一起,这样你就可以将一个庞大的论证分解成许多小块。先编写这个蓝图,然后团队中的其他人可以对论据的不同步骤的不同部分进行形式化。 去年,陶哲轩和几位同事一起解决了一个组合数学问题。这是一个组合学的问题。大约20人在短短三周内完成了,使用了蓝图工具,参与的人中有概率论专家,甚至还有一些并非数学家的人,他们是程序员,但在解决这些小型拼图问题上非常擅长。每个人都挑选了一个觉得自己能做的小任务,并完成了它。 在数学领域,通常很难这么多人一起合作,一般最多可能五个人合作。因为在大项目上合作时,你必须相信每个人的数学都是正确的。但是,一旦超过一定规模,这就无法实现了。但现在借助 Lean 编译器,它能自动检查。团队成员无法上传任何编译不通过的内容,会被拒绝。因此,你可以与一些从未见过的人合作。 最后是讲大语言模型,首先陶哲轩就打脸了 GPT-4 的论文(我猜是微软那篇《GPT-4,通用人工智能的火花》),论文中号称 GPT-4 能解决国际数学奥林匹克问题,但实际上,这个问题不是 2022 年国际奥数竞赛的原始问题,而是一个简化版本,并且他们测试了几百道国际奥数竞赛问题,成功率只有1%,论文里的这个是精心挑选的恰巧能做对的。 并且陶哲轩提到了基于大语言模型的一些改进的方案: 比如 CoT(Chain of Thought),也就是 LLM 做简单的算术运算都做不对,但是如果让它一步步解释,可能就对了。还可以教 AI 一些解题技巧,比如尝试简单的例子,反证法,尝试逐步证明等。 比如让模型和编程语言或者工具连接,将大语言的输出结果交给 Wolfram 这样的专业数学工具或者 Python 这样的编程语言验证,并且迭代的进行修正和验证,直到得到正确的结果,这可以提升大语言模型生成的效果。 即使借助这些手段,大语言模型还远远不能解决大多数数学问题,更不用说数学研究问题了! 当然陶哲轩也没太过打击大家对于 AI 的信心,表示我们在 AI 上还是在不断的取得进展,还提到了他日常是怎么用 AI 的,比如说把 AI 当成灵感之源。 > 我曾遇到过一个问题,我尝试了几种方法,但都无法解决。于是,我尝试询问 GPT,你建议我使用什么其他方法来解决这个问题?GPT 给我提供了 10 种可能的方法,其中有 5 种我已经尝试过,或者明显没有帮助。的确,有几种方法并不实用。但其中有一种我还没尝试过的方法,那就是针对这个问题使用生成函数。当 GPT 建议我使用这种方法时,我意识到这就是我漏掉的正确方法。所以,将 GPT 视为一个交流伙伴,它确实具有一定的用处。 还有使用 GitHub Copilot 帮他写代码,让它自动生成下一步的证明结果,Copilot 的智能提示有 20% 的概率能生成正确的下一步结果。 > 例如我使用的一个叫 GitHub Copilot 的工具,你只需要写下一半的证明,它就会尝试猜测接下来的内容。大概有 20% 的情况下,它能猜到接近正确的答案。然后你就可以说,我接受这个答案。好的,那么在这种情况下,我正在试图证明这个陈述。灰色的部分是 Copilot 给出的建议。结果发现第一行完全没用。不过第二行,尽管你可能看不清楚,却真的解决了这个问题。所以,你不能盲目接受它的输入,因为这些代码未必能顺利编译。但如果你对代码的运作方式已经有所了解,这将大大节省你的时间。这些工具正在变得越来越好。现在如果一个证明只需要一两行,它们就能自动完成。现在已经有了这样的实验,即通过迭代地让 AI 提供证明,然后让编译器进行反馈,如果编译出错,就把错误信息反馈给 AI。通过这种方法,我们开始能够验证四五步长的证明。当然,一个大型的证明可能需要数万行。所以,我们还没有达到能够立即得到一个正式证明的程度。但是,这已经是一个相当有用的工具。 对于大家关心的问题: AI 在数学领域现在到了哪一个阶段?是否未来几年利用 AI 能直接解决数学问题? 陶哲轩也给出了他的看法: > 我认为我们还远远没有达到这个阶段。如果我们专注于非常特定的问题,你可以定制专门的 AI 来处理一小部分问题。即便如此,它们也不是完全可靠的,但还是有用的。不过至少在接下来的几年里,它们基本上将是非常有用的辅助工具,超越了我们已经熟悉的暴力计算辅助。 他还提到了一些可能的 AI 能在数学领域提供帮助的方向: - AI 能够非常好地生成有价值的猜想 > 比如,我们已经看到了关于结理论的例子,它们已经可以推测出两个不同的统计量之间的关系。因此,我们希望能够创建大量的数据集,输入到 AI 中,它们就会自动找出各种不同的数学对象之间的有趣联系。虽然我们还不知道如何做到这一点,部分原因是我们没有这些庞大的数据集。但我认为这是未来可能实现的一个方向。 - 批量或者说规模化的证明大量数学定理 > 现在,因为证明定理是如此繁琐和艰难的过程,我们一次只能证明一个定理,如果你效率很高,可能一次能证明两三个。但是有了 AI,你可以设想一下未来的情况,我们不是试图解决一个问题,而是处理一类类似的1000个问题,然后告诉AI,尝试用这个方法解决这 1000 个问题,然后报告结果,哦,我能用这种技术解决 35% 的问题。那么另一种技术呢?我能解决这个百分比的问题。或者如果结合这些方法,又能解决多少问题?你可以开始探索问题的空间,而不是一个接一个地解决问题。这是你现在根本无法做到的事情,或者是你需要几十年时间,通过数十篇论文慢慢搞清楚各种技术能做什么,不能做什么。但是有了这些工具,你真的可以开始做规模前所未有的数学研究。所以,未来将会非常令人兴奋。 演讲环节结束前的最后一句话说的特别好: > 我们仍然会以传统方式证明定理。事实上,我们必须这样做,因为如果我们自己都不知道如何做这些事情,就无法引导这些 AI。但是我们将能够做很多现在无法做到的事情。 这恰恰也是我们现在使用 AI 辅助编程的问题:如果我们自己都不知道如何构建软件,就很难引导好 AI 帮助我们生成高质量的代码。 尽管 AI 在数学和编程领域变得越来越有用,但人类的洞察力和创造力仍然是创作价值的关键。 原始 YT 视频:

宝玉

302,283 Aufrufe • vor 2 Jahren

先讲一个你可能从来没听说过的人。 1930年,英国语言学家 C.K. Ogden 做了一件很偏执的事——他把整个英语词汇表研究了一遍,然后问了一个问题:如果只能留下最核心的那些词,英语还能不能用? 他的答案是:850个词,够了。 这850个词,不是随便选的,是他穷尽分析之后筛选出来的"语言骨架"。他把它们分成5类: 100个操作词(Operations):这、那、是、有、做……就是那些让句子转起来的胶水词 400个普通事物(General Things):名词里最高频、最基础的那层 200个可描绘事物(Picturable Things):能画出来的具体东西,比如 door、fire、river 100个性质词(Qualities):描述世界的形容词,比如 clear、simple、important 50个反义词(Opposites):成对出现,学一个等于学两个 —————— 然后他把这套体系命名为 Basic English,发表出来。 接下来发生的事情更有意思。丘吉尔在二战期间公开赞扬这套体系,认为它是盟国推广英语教育的最佳基础。H.G. 威尔斯把它写进了《世界大战》的续集设定里,作为未来世界通用语言的蓝图。乔治·奥威尔……没有赞扬它,但《1984》里那套压缩语言"新话"(Newspeak)的灵感,正是来自对 Basic English 的深深警惕——他担心语言被缩减之后,人的思想也会跟着被缩减。 这就是这850个词的能量:支持者觉得它是桥梁,批评者觉得它是枷锁,争论了将近一百年。 但我想说的不是那场争论。我想说的是——这850个词,对今天的英语学习者来说意味着什么。 大多数人学英语,是被一本本厚厚的词汇书和无尽的考纲压着学的。CET-4、CET-6、托福、雅思……每一个证书背后都是几千个词的暴力记忆,背了忘,忘了背,从来没有真正"用"过。 Ogden 给出的逻辑完全相反:不是多,而是深。 这850个词,每一个都是高频中的高频,每一个在日常英语表达里都有不可替代的位置。当你真正把这850个词学透——不只知道它的意思,还知道它的用法、它的近义词在什么场景该用哪一个——你对英语的掌握会比背了5000个词却每个只认识中文意思要扎实得多。 这是一种截然不同的语言观:根扎得够深,枝才能生得够远。 —————— 于是我做了这个网站: (准确的说我让 Codex 做的) 原版 Ogden 的资料是一本PDF,黑白的,排版像上个世纪(它确实是上个世纪的)。我想让它变成真正可以用来学习的东西。 花了不少时间(花了不少 Token )最终做成了这样: 每一个词,都有一张完整的卡片。 卡片上有:这个词的中文释义、英文定义(用简单的英语解释英语,就像 Ogden 本人的风格)、一句真实语境下的例句,以及2到3个同义词。五个类别各有自己的颜色,一眼就知道你在学哪个区域的词汇。 每一个词,都可以听发音。 接的是有道词典的语音接口,默认英式发音,可以切换美式。点单词听一次,点例句听一次,语速比正常稍慢一点,适合跟读。不是那种机械的合成音,真的可以听。 最让我花心思的,是同义词那里。 很多人背单词的时候,同义词只是"差不多的意思"。但真正用英语的时候,difference 和 distinction 不一样,speak 和 talk 不一样,simple 和 easy 不一样。差在哪里?什么场景该用哪个? ——————— 网站是免费的,不需要注册,不会收集任何信息。 直接访问就行: 如果你身边有正在学英语的人,或者觉得自己英语"学了很多年但还是用不好"的,可以发给他们看看。 也许这850个词,是一个值得重新开始的起点。 👆 以上的文案也是它写的,我越来越没有用了

虎小象

973,401 Aufrufe • vor 3 Monaten