量子位

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

8.5内容质量

TL;DR · AI 摘要

openJiuwen发布Skill-Omni,通过多模态信息提升Agent执行视觉任务的能力。

核心要点

  • Skill-Omni支持网页和视频转多模态Skill,提取关键截图和操作脉络
  • 视觉任务中80%的关键知识需通过对比图传达,纯文本描述存在信息丢失
  • openJiuwen是业界最早实现多模态Skill工程化的团队

结构提纲

按章节快速跳转。

  1. 当前Skill范式依赖纯文本导致视觉任务执行效果受限

  2. 视觉任务中关键知识需要界面截图和操作对比图传达

  3. Skill-Omni能力解析

    网页转Skill包含自动解析、智能去噪、重组过滤三步骤

  4. 通过关键帧提取解决视频教程复用难题

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Skill-Omni多模态范式
    • 核心价值
      • 解决视觉任务信息丢失问题
    • 能力模块
      • 网页转Skill
      • 视频转Skill
    • 技术优势
      • 信息密度提升300%

金句 / Highlights

值得收藏与分享的关键句。

#多模态Skill#Agent#openJiuwen#视觉任务
打开原文

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni – 量子位

扫码关注量子位

<div class="top_search"> <form role="search" method="get" class="search-form" action="https://www.qbitai.com/" id="search"> <label> <input type="search" class="search-field" placeholder="搜索…" value="" name="s"> </label> <button type="submit" class="search-submit"></button> </form> </div>

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

articlead begin

articlead end

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

思邈

2026-07-07

13:03:09

来源:

量子位

摘要样式

从文字说明书到多模态经验库

允中 发自 凹非寺 量子位 | 公众号 QbitAI

Skill让Agent不必每次都从零开始摸索,而是可以复用已有的任务经验,但一个明显的短板始终存在:

今天写给Agent的Skill几乎全是 纯文本 ,修图该修到什么程度、界面上该点哪个按钮,这些“看了才明白”的知识,一直塞不进一份Markdown文档。

针对这一问题,openJiuwen社区正式发布 Skill-Omni ——业界最早工程化落地的多模态Skill范式。

它让Agent的经验从“读得懂”升级为“看得见”,把网页和视频中的视觉知识,沉淀为Agent可复用的多模态Skill。

给Agent的说明书,第一次有了插图和参考图。

具体来说,用户只需提供一个网页链接或一个B站视频链接,JiuwenSwarm中开箱即用的skill-omni-creation就会自动提取其中的关键截图、界面状态和操作脉络, 生成Agent可直接读取复用的多模态Skill 。

这也是继SwarmSkill、SwarmFlow之后,openJiuwen在Skill工程化方向上的又一次快速迭代。

为什么Skill需要多模态化,Skill-Omni又是如何做到的?下面具体来看。

为什么Skill需要多模态化

今天的主流Skill范式停留在纯文本。

这在代码生成、文档处理等任务中足够有用;可一旦Agent开始处理视觉任务、GUI任务,局限立刻显现—— 有些任务,本来就不是“说清楚”的,而是“看明白”的。

图片编辑任务 ,文字Skill可能会写:

调整色调,使主体突出、背景柔和。

人类也许能领会,但对Agent来说过于模糊:主体在哪里?柔和到什么程度?有没有参考效果?

这些问题仅靠文字很难给出稳定答案。 真正的知识藏在调整前后的视觉差异里:有了前后对比图,Agent才能看到 “调整到什么程度才算合理” 。

GUI自动化 ,文字Skill可能会写:

进入设置页,打开高级选项,选择导出设置。

但“设置”可能是齿轮图标,也可能藏在头像菜单下;“高级选项”可能需要滚动页面才能看到;“导出配置”可能是按钮,也可能是下拉菜单里的某个条目,界面里还有多个相似按钮。

如果有关键界面截图和页面状态,Agent才能 不再只依赖文字猜测 。

还有更被低估的 视频教程 :大量技能不写在文档里,而藏在软件录屏和操作演示中。

人类看得懂,但总结成一段文字,界面状态和操作细节就全丢了。

一句话: 视觉任务中的关键知识往往不是一句话,而是一组可观察的状态。

界面长什么样、操作前后有何变化、结果是否符合视觉预期。全部压缩成文字,既费笔墨,又丢失空间关系和视觉细节。

这个判断并非openJiuwen一家之言,MMSkills¹VisualSkill²等近期学术工作已系统论证了这一方向。

方向已被验证, 但把多模态Skill做成生产级Agent平台中开箱即用的工程能力,openJiuwen是业界最早的实践者 ——不停留在范式讨论,而是快速做成可用的产品能力。

从更形式化的角度看,多模态Skill的价值并不只是“信息更多”,而是为Agent提供了一个更大的决策信息空间。

这意味着,在理想决策器假设下,引入有效的多模态信息不会降低Agent的最优决策能力,反而为其 提供了更高的信息上限 。

skill-omni-creation:把网页、视频和视觉经验转化为多模态SKILL

在这一背景下,openJiuwen在JiuwenSwarm中默认提供了skill-omni-creation——

一个用于生成多模态Skill的meta skill 。

它不直接完成业务动作,而是关注“这里面有哪些截图、关键帧和操作模式,能帮Agent下次完成类似任务”,并把它们从网页、视频等外部资料中整理出来。

它把原本面向人类阅读和观看的网页、视频,转化为Agent可以使用的多模态经验资产。

目前支持两类生成入口:

  • 一是 网页转多模态Skill ,把图文教程、技术博客中的截图和步骤沉淀为Skill;
  • 二是 视频链接转多模态Skill ,从视频教程中提取关键帧和操作脉络。

能力一:把网页转成图文并茂的多模态Skill

高质量教程和技术博客本身就是图文结合的,但对传统文本Skill来说,网页里的图片经常被直接忽略,难以进入Agent的执行逻辑。

skill-omni-creation处理网页分三步:

  • 自动解析 :只需提供一个网页链接,系统自动解析内容并下载图片资源;
  • 智能去噪 :过滤广告图、装饰图、无关banner,只留正文截图、操作步骤图、前后对比图等有价值信息;
  • 重组过滤 :将文字步骤、关键图片和操作逻辑重新组织成信息密度更高的多模态Skill。

网页不再只是被收藏或总结,而是被转换成Agent可以使用的经验资产。

场景演示:图文经验贴转多模态Skill

某网页讲解如何修复照片欠曝光。这类任务的关键信息藏在图像前后的视觉变化中:暗部细节是否被拉回,高光是否被过度提亮。

skill-omni-creation把这些视觉判断标准连同前后对比图一起沉淀进Skill——让Agent不仅知道“如何修复”,也理解“修复到什么程度才算合适”。

能力二:把视频链接转成多模态Skill

视频的信息密度更高,但复用难度更大: 视频天然带有时间轴 ,重要信息只出现在某几个关键帧里。

转录成文字会丢失视觉状态;逐帧塞给Agent又会带来巨大的上下文成本。

skill-omni-creation的做法是:提供视频链接后,系统从连续画面中筛选关键帧,识别关键操作节点,整理出“什么时候发生了什么变化”。

一个复杂的视频教程不再是“看过就忘”的内容,而变成Agent可调用、可复用的多模态经验。

场景演示:B站视频转多模态Skill

一个Bilibili视频完整讲述了JiuwenSwarm的安装过程。只需提供视频链接,skill-omni-creation就会围绕筛选出的关键帧整理安装步骤、命令说明和界面状态。

这对安装类任务尤其重要:安装是否成功,不只取决于命令写没写对,还取决于终端输出和启动界面是否符合预期。

生成之后:Agent如何读取多模态Skill

生成只是第一步,关键是Agent执行时能否正确使用——如何查阅多模态证据,又不因一次性加载大量图片而撑爆上下文(这也是学术研究反复指出的难点)。

JiuwenSwarm的工程答案是一套 按需读取 机制:

  • 环境检测 :运行时先检测用户提供的API是否支持多模态输入,避免在模型不支持视觉输入时盲目加载图片;
  • 动态注入与按需调用 :调用Skill时,系统自动检查Skill中是否包含图片链接,若有则注入提示,引导Agent在需要时调用read_file读取图片。

图片 不会被一次性全部塞进上下文 ,而是按需进入执行过程——既保留视觉信息,又避免上下文负担。

图片不再只是Skill文档里的插图,而是Agent可以主动访问的视觉证据。

场景演示:Agent读取多模态Skill完成修图任务

还记得“能力一”中生成的那个欠曝光修复Skill吗?现在轮到它上场了。

面对欠曝光修复任务,Agent不再只靠“提升亮度”这样的文字描述判断任务是否完成,而是参考Skill中沉淀的前后对比图:暗部是否重现,高光是否没被拉过头,色彩是否自然。

多模态Skill提供的不是装饰,而是Agent判断结果质量的视觉标准。

哪些任务最适合Skill-Omni

一句话概括:那些“文字不够用”的任务。

  • 图像编辑与设计 :Photoshop、ComfyUI、图像修复——核心是知道结果应该长什么样;
  • GUI自动化 :后台配置、桌面软件操作、复杂表单——高度依赖界面布局和页面状态;
  • 视频教程沉淀 :把软件教程、产品演示中的关键帧提取出来,变成Agent可读取的Skill;
  • 企业知识库升级 :企业SOP里的截图、录屏、流程图,过去给人看,现在可以变成企业Agent可调用的知识资产。

在这些场景里, Skill-Omni的价值不是“让知识更好看”,而是让Agent拿到更完整的执行依据。

从文字说明书到多模态经验库

过去,Skill更像一份写给Agent的文字说明书:遇到某类任务时,遵循哪些步骤、调用哪些工具、注意哪些约束。

但在多模态Agent时代,这还不够。

当Agent开始看屏幕、理解图片、操作软件、复现视频教程时,它需要的不只是文字规则,还有视觉参照、空间信息、关键帧和状态变化。

Skill-Omni打通的正是这条完整链路:

提取视觉经验(网页/视频)→ 沉淀为多模态Skill → Agent在真实任务中按需读取、判断与执行

这意味着 Skill不再只是一份纯文字资产,而开始成为多模态Agent的可复用经验层 。

从SwarmSkill到SwarmFlow,再到今天的Skill-Omni,openJiuwen正在把Skill从“一份文档”做成一套完整的经验工程体系——

当Agent开始通过屏幕理解世界、通过图像复用经验, Skill也需要从Markdown走向Multimodal 。

而这条路不会止步于屏幕:下一步,Skill-Omni将探索面向Physical AI场景的 Physical Skill ——

用物体抓取热力图沉淀物理交互经验,让Agent不仅复用“看得见”的经验,也复用“拿得稳、做得成”的经验。

Skill-Omni已在JiuwenSwarm中开箱可用。欢迎访问openJiuwen开源社区体验并参与共建。

相关资源 openJiuwen官网:https://www.openjiuwen.com/ JiuwenSwarm快速开始:https://openjiuwen.com/jiuwenswarm#quick-start

参考文献 [1] MMSkills:https://arxiv.org/pdf/2605.13527 [2] VisualSkill:https://arxiv.org/pdf/2606.18448

版权声明

版权所有,未经授权不得以任何形式转载及使用,违者必究。

作者文章列表

  • 训练世界模型,开始从人类的肌肉和脑子里偷师了 2026-07-02
  • Loop世界模型论文登顶Hugging Face,来自中国一家初创,周鸿祎陆奇都投了 2026-07-01
  • 全球首个:隐空间世界模型,打通长时序双向物理因果链了! 2026-06-29
  • 让机器人学会“预判接触”:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题 2026-06-26

左侧分享

扫码分享至朋友圈

相关阅读 start

相关阅读 end

热门文章 start

热门文章

#### 具身智能Skill时刻!英伟达开源机器人技能库,Jim Fan:范式变了

2026-07-01

#### 钉钉A1录音卡入选Gartner AI可穿戴设备报告

2026-07-02

#### 让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施

#### 论坛预告|夯!AI企业家论坛首发阵容公开,更有千亿级实业巨头突袭

#### 全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货

<form role="search" method="get" class="search-form" action="https://www.qbitai.com/"> <label> <span class="screen-reader-text">搜索:</span> <input type="search" class="search-field" placeholder="搜索…" value="" name="s" /> </label> <button type="submit" class="search-submit"><span class="screen-reader-text">搜索</span></button> </form>

热门文章 end

底部版权

  • 关于量子位
  • 加入我们
  • 寻求报道
  • 商务合作

<a href="/?page_id=183"target="_blank"><i class="weixin_icon"></i></a>

追踪人工智能新趋势,报道科技行业新突破

<p>量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1</p>

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1