登录

思维链


分类

推理

不过,OpenAI目前尚未发现Astra具备隐写式思维链推理的证据,表明规避风险可能主要局限于不需要思维链就能完成的任务。
文章

效果

研究发现,Astra控制自身思维链的能力更强,在对抗性条件下(即被推动去规避监控时),模型能够在评估中策略性表现不佳(即“沙袋”行为)而不被发现,有时还能规避内部监控。
文章