New Anthropic Fellows research: Model Spec Midtraining (MSM). Standard alignment methods train AIs ...
Anthropic(@AnthropicAI)288 字 (约 2 分钟)
72
Anthropic 提出 Model Spec Midtraining(MSM)新对齐方法:不只教AI‘做什么’,更在训练中期注入‘如何泛化及为何如此’的规范性指令,提升零样本泛化能力。
入选理由:MSM 在模型训练中期插入规范性指令,而非仅依赖后训练对齐示例。
精选推文#AI alignment#LLM safety#Anthropic#machine learning中文
