正在加载视频...
视频加载失败
这个机器人项目的思路还是很牛逼的: LLM无法直接输出操作低端机器人命令,但是可以换一种思路:让LLM生成python的奖励函数代码,从而达到训练机器人的目的。 这个项目利用一个Reward Translator(奖励翻译器): 首先将自然语言的运动描述按照指定的模板翻译成一个更符合机器人的动作描述。 然后将这个动作描述翻译成Python版本的奖励函数 再用运动控制器优化生成的奖励函数。 项目地址:
107,801 次观看 • 3 年前 •via X (Twitter)
9 条评论

微博用户@建筑狂人 对这个思路的绝妙比喻: @建筑狂人: 就类似公司领导不能直接操纵你的个人行为,但是可以操纵给你发钱的奖励机制,通过这个方式来训练你干活。等人工智能的智力远远超过人类以后,他们也可以用这套机制来控制人类社会

@memdotai mem it @readwise save thread @threadreaderapp unroll @SaveToNotion #thread

@vincentcplus @dotey @memdotai @readwise @SaveToNotion @vincentcplus Sorry we only unroll consecutive tweets from the same author, but if you want to grab the whole convo try @pdfmakerapp! 🤖

@memdotai mem it @readwise save thread @threadreaderapp unroll @SaveToNotion #thread

@dotey @memdotai @readwise @SaveToNotion @erichs19290201 Sorry we only unroll consecutive tweets from the same author, but if you want to grab the whole convo try @pdfmakerapp! 🤖

@SaveToNotion #thread #tweet #机器人

围绕gpt目前的langchian、agent、function再加上这个奖励函数模式。将程序视角拉远到产品和用户视角

@memdotai mem it

@dotey Saved! Here's the compiled thread: 🪄 AI-generated summary: "这个机器人项目的思路是利用LLM生成python的奖励函数代码,从而达到训练机器人的目的,微博用户@建筑狂人比喻这个思路"
