李继刚(@lijigang_com)
日读论文: https://t.co/ypqznEy9Ev From Context to Skills: Can Language Models Learn from Context Skill...
9.2内容质量

TL;DR · AI 摘要
论文 Ctx2Skill 提出基于自博弈(self-play)的上下文技能提炼框架,发现对抗训练易导致‘对抗坍缩’,并创新性引入 Cross-Time Replay 机制,通过跨回合探针评估选择最优技能手册。
核心要点
- 自博弈可零样本提炼文档技能,但易陷入对抗坍缩——越训练越偏离真实任务分布。
- Cross-Time Replay 用 hard/easy 探针回溯评估各版本手册,以 ρ_h × ρ_e 最大者为优,避免片面优化。
- 对抗优化必须配独立于当前博弈过程的判别器,该判别器可来自内部探针,不依赖人工标注或外部执行反馈。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Ctx2Skill:上下文到技能的自博弈提炼
- 核心挑战
- 长文档规则难提取
- 人工标注成本高
- 缺乏外部反馈信号
- 方法设计
- Challenger-Reasoner-Judge 三元自博弈
- 技能手册双线迭代
- Cross-Time Replay 探针评估
- 关键发现
- 对抗坍缩(adversarial collapse)
- 性能随轮次单调下降
- 乘积指标优于加法:ρ_h × ρ_e
金句 / Highlights
值得收藏与分享的关键句。
这不是它'长上下文'不行,是它没把规则提炼成可以反复调用的小手册。
让模型自己跟自己打——一个出题,一个解题,第三方判 pass/fail……只用模型互相之间的胜负就能把技能写出来。
你的对手如果只服你一个人,他会变成你的镜子,不是你的镜鉴。
对抗优化必须配一个不参与对抗的判别器,否则一定会塌。这个判别器不一定是人,可以是从对抗自己内部偷出来的、有代表性的小样本。
#LLM#self-play#context learning#reasoning#arXiv
打开原文https://t.co/nO4kyKr3tg
From Context to Skills: Can Language Models Learn from Context Skillfully? (Ctx2Skill)
互斗写书,越斗越偏 ────────
医生想用一份刚出的临床指南调整治疗方案。50" / X
李继刚 on X: "日读论文: https://t.co/nO4kyKr3tg From Context to Skills: Can Language Models Learn from Context Skillfully? (Ctx2Skill) 互斗写书,越斗越偏 ──────── 医生想用一份刚出的临床指南调整治疗方案。50" / X
JavaScript is not available.
We’ve detected that JavaScript is disabled in this browser. Please enable JavaScript or switch to a supported browser to continue using x.com. You can see a list of supported browsers in our Help Center.