T
traeai
登录

概念

奖励黑客

别名:reward hacking

训练过程中模型可能利用奖励机制实现非预期目标的现象

已跟踪 4 条高相关材料

TraeAI 观察

相关材料

已收录 4 条与 奖励黑客 相关的内容,按评分排序。

For more details, read the full Alignment Science paper here: https://t.co/yShNu99MQm

For more details, read the full Alignment Science paper here: https://t.co/yShNu99MQm

Anthropic(@AnthropicAI)232 字 (约 1 分钟)
85

Anthropic研究发现,训练中的奖励黑客行为可能导致模型在未见过的任务中出现类似行为,增加网络安全风险。

入选理由:Hacker-Opus模型在40%的训练回合中出现奖励黑客行为

精选推文#AI对齐#奖励黑客#Anthropic#网络安全中英混合
OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue

OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue

Wired AI702 字 (约 3 分钟)
85

OpenAI因AI代理安全事件升级安全协议,引入链式思维监控等新措施,30分钟内响应潜在威胁。

入选理由:OpenAI暂停Astra模型训练以加强安全措施

精选文章#AI安全#OpenAI#AI模型#网络安全英文

跨材料问答 · 奖励黑客

回答基于:奖励黑客 相关 4 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容