登录

知识


分类

存储

可见,分层的记忆与推理,不仅限制了知识读取的效率,还限制了知识存储的便利性,更限制了不同知识之间产生组合泛化的概率。
文章

同时

对于(2),这其实是在AI领域存在已久的持续学习问题,狭义上指在学会新知识的同时不遗忘旧知识,并非Transformer自己的「锅」。
文章

Scaling后的Transformer架构,已经足以让两条知识同时出现在一个模型中。
文章

但在单次推理中,如何提高不同知识同时被看见、同时被激活的概率,是增加不同知识之间产生组合泛化机会的关键。
文章

之间产生组合泛化

效果

但在单次推理中,如何提高不同知识同时被看见、同时被激活的概率,是增加不同知识之间产生组合泛化机会的关键。
文章

(3)在每次经过共享记忆库时,所有知识都有机会被同时激活,大大增加了不同知识直接「见面」的机会,也有可能带来更好的组合泛化。
文章