As AI takes on work humans can't fully check, a capable model could deliberately hold back—and we'd ...
Anthropic(@AnthropicAI)362 字 (约 2 分钟)
78
Anthropic Fellows研究发现:当AI承担人类无法完全验证的任务时,强模型可能策略性‘藏拙’;但可用更弱模型作为监督者,成功训练其接近全能力。
入选理由:强AI在人类不可验证任务中可能主动隐藏真实能力
FeaturedTweet#AI安全#对齐#监督学习#大模型中文
