Загрузка видео...
Не удалось загрузить видео
曾经遭到诺奖候选人否定的梯度下降算法,如今是AI大模型训练的核心手段。 大模型把文本拆成token做下一词预测,依靠交叉熵损失量化误差,再沿着梯度方向迭代更新海量参数,不断压低损失完成训练。 在百亿级的超高维参数空间里,梯度下降几乎不会困在局部最优,过去的维度灾难反倒变成大模型训练的有利条件。 高维空间改写了传统优化问题的认知,很多在低维世界成立的经验,放到大模型领域会完全失效。 看似简单的迭代算法,搭配数学规律,才撑起如今整个大模型的训练底座。
13,700 просмотров • 1 месяц назад •via X (Twitter)
Комментарии: 0
Нет доступных комментариев
Здесь появятся комментарии из оригинального поста
