登录

预训练


描述

这位00后创始人相信,预训练是智能产生的根源,世界模型本质上是多模态模型的延伸,关键在于引入物理模态后怎么把多模态的方法论落实。
文章

分类

预训练

例如,完全不同的架构、优化方法、神经形态硬件、模拟计算,或者基于强化学习预训练、显式世界模型的新路线。
文章

当大模型预训练还在靠一堆“炼丹术”般的启发式规则苦苦调参时,哈佛大学计算机科学系GordonMcKay教授、Kempner研究所联合主任ShamKakade抛出了一项反直觉的研究:一个简单到离谱的二次模型,就能精准预测大语言模型在动态预训练中的绝大部分优化效果。
文章

坦率地说,我认为大模型预训练(Pretraining)这一范式在短期内不会消亡。
文章

现在我们来看大语言模型预训练(LLMPretraining)场景下的任意时间学习问题。
文章

模型

GeneralistAI在7月刚刚公布了模型的一项新能力——同一个预训练模型可以驱动五花八门的末端执行器,除了常见的夹爪,还有电动螺丝刀和打蛋器这类专用工具。
文章

本质

2026年07月23日12:03雷锋网极简二次模型,还原LLM预训练的本质。
文章

它不是去拟合训练数据,而是直接还原了预训练的本质。
文章

影响

二次模型对哪些预训练优化问题有指导作用?
文章