🧠 Paradigm II — Agent Foundation Model: world modeling as agent capability. Single-turn, non-agent...

TL;DR · AI 摘要
Paradigm II 模型通过世界建模能力实现多任务推理,无需特定任务微调即可在多个基准测试中取得显著提升。
核心要点
- Paradigm II 模型在 7 个基准测试中表现优异,包括 3 个完全超出训练域的任务。
- 模型通过世界建模实现 '预测先行' 的推理模式,无需强化学习或任务特定微调。
- 在 In-domain 任务中,Terminal-Bench 2.0 提升 6.3%,SWE-Bench 提升 3.4%。
结构提纲
按章节快速跳转。
- §引言
介绍 Paradigm II 模型的核心目标和应用场景。
- ·模型特点
Paradigm II 模型无需强化学习或任务特定微调即可实现多任务推理。
- ›测试结果
模型在 7 个基准测试中表现优异,包括 3 个完全超出训练域的任务。
- ·推理机制
模型通过世界建模实现 '预测先行' 的推理模式,提升任务表现。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Paradigm II 模型
- 模型特点
- 无需强化学习
- 无需任务特定微调
- 测试结果
- 7 个基准测试表现优异
- 3 个超出训练域任务
- 推理机制
- 世界建模实现 '预测先行' 推理
金句 / Highlights
值得收藏与分享的关键句。
Paradigm II 模型在 7 个基准测试中表现优异,包括 3 个完全超出训练域的任务。
模型通过世界建模实现 '预测先行' 的推理模式,无需强化学习或任务特定微调。
在 In-domain 任务中,Terminal-Bench 2.0 提升 6.3%,SWE-Bench 提升 3.4%。
Qwen on X: "🧠 Paradigm II — Agent Foundation Model: world modeling as agent capability. Single-turn, non-agentic environment prediction → tested directly on multi-turn, tool-calling agent tasks. No agentic RL, no task-specific tuning. Gains across 7 benchmarks, including 3 entirely https://t.co/yNl5caRric" / X
Qwen
@Alibaba_Qwen
Replying to
🧠 Paradigm II — Agent Foundation Model: world modeling as agent capability. Single-turn, non-agentic environment prediction → tested directly on multi-turn, tool-calling agent tasks. No agentic RL, no task-specific tuning. Gains across 7 benchmarks, including 3 entirely out-of-domain: - In-domain: Terminal-Bench 2.0 +6.3, SWE-Bench +3.4, WideSearch +12.8 - Out-of-domain: Claw-Eval +11.3, QwenClawBench +9.7, BFCL v4 +9.0 World modeling internalizes "predict before you act" as a transferable reasoning pattern.
9:52 AM · Jun 24, 2026
22.9K
Views
3
5
8
9
89
1
18
Read 3 replies