Loading video...

Video Failed to Load

Go Home

这是北京大学关于AI未来人类的去向值得思考的话题: 如果AI神话真的会取代人类, 那到时的人类最需要具备的到底是什么?

12,376 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

斯坦福2023年公开课CS25 - 大语言模型与人类对齐(中英文字幕) 这是斯坦福2023年公开课CS25的第二课:《Language and Human Alignment》,讲师是OpenAI的Jan,他目前领导OpenAI的对齐(Alignment)团队,并曾在DeepMind担任研究员。他拥有强化学习理论博士学位,并且在过去的10年里一直在思考对齐问题。 这节课的主要内容是探讨AI的对齐问题,也就是如何让AI系统符合人类的意图和偏好,以及如何构建能遵循人类意图的AI系统? 遵循人类意图意味着:对于明确的意图,能遵循指令,成为一个可靠的助手;对于不明确的意图,需要通过后续问题明确,不要编造,不要做有害的事情。 现在使用的主要技术是强化学习反馈,这是用来训练InstructGPT和ChatGPT的技术。首先需要训练一个奖励模型,然后要用人类标注员去标注数据,来告诉模型哪些结果更是人类想要的。虽然每个人类标注员都有自己的偏好,甚至可能有不一致的地方,但模型会多结果进行平均。 从成本上来说,人类反馈的成本要远低于预训练的成本,不到预训练计算量的2%。基于人类反馈的强化学习(RLHF)可以让模型做任何它想做的事情,它可以自己找出最好的方法来做事情,你只需要对它的结果进行评估就好了。 “评估比生成容易” 很多任务虽然人类不擅长,但是可以很容易的给出评估。 RLHF也有一些限制,比如当人工智能进化到一定程度,其可以完成的任务难度也会提升,但是人类评估任务的水平却无法提高,这时候人类将无法再给AI有效的反馈。所以未来我们需要AI来辅助人类进行评估,让AI帮助指出结果中的问题,人类对AI评估的结果进行评估。 课程页面: 参考材料: - ChatGPT: - InstructGPT: - Language Models are Few-Shot Learners (GPT-3):

宝玉

149,159 views • 3 years ago