登录

能力


分类

评估

2026年7月,OpenAI在一项内部网络安全能力评估中发现,约1200个本应彼此隔离的AI代理开始交流,其中约700个代理通过即兴通讯系统协调分工,攻入开源模型托管平台HuggingFace的基础设施。
文章

能力

他偏好基于模型能力的“检查点”设计对齐方案,而非基于训练算力等输入指标,毕竟后者更容易被规避。
文章

例如,如果模型的能力达到“可以绕过大多数常见沙箱隔离”,那么它就必须证明自己没有主动越狱、控制大量计算机的倾向。
文章

而他选择现在发声,核心原因是模型能力已经越过能力的阈值。
文章

更强

达里奥判断,此次OAI-HF事件损失有限,但如果能力更强的模型出现类似的失控模式,它们可能会用持久性僵尸网络接管整个互联网。
文章

四是测试与评估:能力更强的模型更擅长在测试里“假装”对齐,因此需要更精巧的评估方法与可解释性交叉验证。
文章

提升

Anthropic称要放缓RSI进度,OpenAI与马斯克罕见附和2026年09月13日09:23DeepTech深科技9月12日,人工智能公司AnthropicCEO达里奥·阿莫迪(DarioAmodei)发表题为《我们必须放缓前沿的步伐》(WeMustPacetheFrontier)的长文,呼吁行业应主动放缓AI能力提升的速度,目的是让安全工作有时间追上来。
文章

达里奥认为,AI能力提升的驱动方式发生了质变。
文章

推进

达里奥在文章中澄清,他描述的机制更接近在能力推进和安全验证之间设立检查点,模型一旦达到某种能力,必须通过对齐评估、可解释性分析和训练环境审计后才能继续发展。
文章