Datawhale

阿里最新发布,千问AI平台Token Plan实测来了!

8.5内容质量
阿里最新发布,千问AI平台Token Plan实测来了!

TL;DR · AI 摘要

阿里云推出千问AI平台,支持Agent自主控制模型,实测展示15秒短片生成全流程。

核心要点

  • 千问AI平台整合Qwen/Kimi/DeepSeek等100+模型,单API Key调用
  • 开源两个Skill实现Agent自主模型切换,测试案例用3个模型完成15秒短片
  • 平台提供免费额度,包含文本/图像/视频/语音四类模型

结构提纲

按章节快速跳转。

  1. 阿里云推出千问AI平台,整合100+模型并提供免费额度

  2. 通过开源Skill实现Agent自主控制模型调用

  3. 分四步完成API Key获取与Skill安装部署

  4. 15秒短片生成使用3个模型完成4类模态处理

  5. 标志着模型服务平台从人工转向Agent主导

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 千问AI平台
    • Agent自主控制
      • 模型切换
      • Skill开源
    • 模型聚合
      • 100+模型
      • 多模态支持
    • 实测案例
      • 15秒短片
      • 3模型协同

金句 / Highlights

值得收藏与分享的关键句。

#AI平台#模型聚合#Agent控制#实测案例
打开原文

Datawhale干货

**作者:筱可,Datawhale成员**

阿里最新发布了千问AI平台,把 Qwen、Kimi、DeepSeek 等一百多个系列的模型聚到一个平台上,一个 API Key 就能调。注册还带一批免费额度,不少顶级模型可以直接免费试。

发布同时还开源了两个官方 Skill,让 AI Agent 终于可以自主控制模型了。

Image 1: Image
Image 1: Image

我们拿其中的qianwen-ai完整跑了一轮测试:

给它一段小水豚的故事,让它自己做成短片。最后完成了一条 15 秒、带配音的成片:3 幕分镜、3 张关键帧、3 段图生视频、3 句旁白配音,横跨文本、图像、视频、语音四类模型、五个子技能。

全程只靠Agent 自己操控,自动切换了三个模型:wan2.6-i2v-flash、qwen3-tts-flash、wan2.6-t2i。下面,我们把整个过程和实测数据完整分享出来。

一、过去的模型服务平台是给人用的,以后是给 Agent 用的

一个模型干不完所有事。

不同模型擅长的方向不一样,Agent 跑一个任务,中途换好几个模型很正常。任务本身也有轻有重,简单的步骤用便宜的模型就够,能省下不少成本。

这些判断以前都靠人:哪一步该换模型、换成哪个、便宜的够不够用。可 Agent 一跑就是几千次调用、很久都不停,人没法一步步盯着。

模型平台也差不多卡在这一步。早期是单家模型的 API,换个模型就得改代码。后来有了聚合网关,一个 Key 能调很多家,比价和切换方便了,但挑哪个、什么时候挑,还是人在动手。千问AI 平台想往前走一步,把选模型、调用、部署做成官方开源的 Skill,交给 Agent 自己来。

阿里云资深副总裁刘伟光在发布时说:过去的模型服务平台是给人用的,以后用模型的主力是 Agent,千问AI 平台要给开发者和 Agent 都提供更顺手的体验。

接下来,我们通过一个完整的测试让 Agent 自主控制模型。

二、实测「Agent 自主控制模型」的全流程

第一步:进入控制台

打开https://platform.qianwenai.com注册登录,进入控制台。

第二步:获取 API Key

进控制台打开 API Keys 页https://platform.qianwenai.com/home/api-keys

OpenAI 兼容:https://dashscope.aliyuncs.com/compatible-mode/v1Anthropic 兼容:https://dashscope.aliyuncs.com/apps/anthropic

Image 2: Image
Image 2: Image

右上角点创建 API Key,填个描述名称,点生成。

Image 3: Image
Image 3: Image

生成后在列表里点复制按钮,Key 就拿到了。提醒一句,Key 只完整显示一次,记得当场存好。

Image 4: Image
Image 4: Image

第三步:安装 qianwen-ai skill

有了 Key,再把官方 skill 装上,Agent 就可以使用千问AI 平台自主控制模型了。

qianwen-ai是一条命令的事,走标准的 Agent Skills 分发机制,只需要 Node.js 18 以上:

npx skills add QianWen-AI/qianwen-ai 跑起来会自动克隆仓库、列出技能,全选确认就装好了。

这里有个实测才发现的细节:它装出来是 9 个子技能,覆盖文本、图像、视频、语音、视觉理解、模型推荐、认证、用量查询、版本更新。官方 README 当时的清单只列了 8 个,漏了一个版本更新检查,以实际装出来的为准。

Image 5: Image
Image 5: Image
Image 6: Image
Image 6: Image
Image 7: Image
Image 7: Image

装好后,负责认证的qianwen-ops-auth子技能会引导你把上面拿到的 Key 配好。

到这一步,Key 拿到了、skill 装上了,可以开始使唤 Agent 了。

第四步:测试 Agent 自主选择模型

我们让它画一张千问的吉祥物:

你来让他帮我生成一个图片,就是千问的专属吉祥物,你可以联网搜索一下看看,其实是一只水豚,你试试生产他吧 Agent 先联网确认了这个形象,再自己主动调用了qianwen-image-generation的文生图模型 wan2.6-t2i 出图,得到一只圆滚滚、呆萌治愈的卡通水豚,扁平插画风、干净浅背景,拿来当品牌吉祥物。

Image 8: ImageImage 9: ImageImage 10: Image

一句话需求发出去,Agent 自己选模型、调用、把结果取回来,不用人去别的页面挑模型、配参数。

选型这一步由 9 个子技能里的qianwen-model-selector负责。它不干活,只做判断:画图、做视频、配音这些执行子技能动手前,先来问它这一步该用哪个模型,拿到答案再去调。

它的判断分三层,逐层缩小范围。第一层看需求类型,是画图、生成视频还是文字转语音,先框出能干这活的一批模型。第二层看使用场景,临时试一下就挑质量高的,要上量生产就挑更快更便宜的。第三层比单价,在剩下的候选里选成本最合适的那个。三层走完模型就定了,这次测试里它定的是 wan2.6-t2i。

这套选型是加分项,不是必需项。不装它也能跑,每个执行子技能都自带一个默认模型,区别只是少了比价和择优这一层,不会因为缺了这一环整条链就断掉。对刚上手的人来说,装上就直接用得上,选型的活它替你做了。

第五步:测试 Agent 自主编排模型

单点调用跑通后,我们又测了编排,让 Agent 把多个子技能连起来做一件完整的事。

我们给它一个故事:小水豚想去河边游泳,先在家跟妈妈说,然后独自出门在傍晚迷了路,妈妈找到他带回家;第二天,妈妈陪着他一起去河边游泳。

从这段话到成片,只需要一次输入,剩下的五个子技能由 Agent 自己一环接一环调完:

  • qianwen-text 把故事写成 3 幕分镜,每幕一句画面描述加一句旁白。
  • qianwen-image-generation按分镜生成 3 张关键帧图,1280×720。
  • qianwen-video-generation做图生视频,把每张关键帧驱动成 5 秒的动态镜头。
  • qianwen-audio-tts把 3 句旁白配成语音。
  • 最后用 ffmpeg 合成一条 15 秒、带配音的完整短片。

我们没告诉它要分 3 幕,也没说每幕多长、哪张图配哪句旁白,这些是它拆出来的。分镜文字进画图模型得到关键帧,关键帧进视频模型驱动成镜头,旁白文字进配音模型得到语音,最后所有片段和音轨一起交给 ffmpeg。

比拆步骤更麻烦的是这几步节奏不一样。文本和配音基本是同步返回,图生视频是异步任务,提交完要排队、轮询、算完再取结果,每段 5 秒的镜头大约 3 到 4 分钟。三段什么时候都跑完、素材什么时候齐了才能进合成,这些都是Agent 自己在判断并执行。

整条链跑了十几分钟,中间换了四类模态、三个模型。要是这些模型分散在几家,每换一次就多一道手续:另一个 Key、另一套 SDK、另一份文档。这次因为是一个 Key、一个 skill 入口,所以环境没另配,格式也没手工转,选模型的活qianwen-model-selector就直接完成了。

三、实测下来的三个感受

一条完整的编排链,能在一个平台完成并看到花费

含 3 段图生视频的那条链,加上前面单点调模型的测试,一共 ¥5.35。Agent 调了什么,在千问AI 平台的后台记得清楚。用量日志里逐条列着请求来源是 Skills,模型是 wan2.6-t2i、wan2.6-i2v-flash、qwen3-tts-flash,时长、延迟、状态都在。

Image 11: Image
Image 11: Image

计费这块 Token Plan 也上了平台,按平台能力算,不按单个模型分。一份 Credits 全平台通用,调 Qwen 还是换 DeepSeek 都从这份里扣,不用再给每个模型单独买套餐,使用下来感觉很方便。

Image 12: Image
Image 12: Image

换模型只改一个模型名,工程都不需要动

这次测试图快,在形象一致性和画质都有短板,用的是 wan2.6-i2v-flash,在细节、时长、分辨率上都做了取舍,这是为控制体验成本主动选的,不代表平台视频生成的上限。

想要好效果,跟 Agent 说一句换成 wan2.7-i2v 就行,1080P、首尾帧控制、更长时长都有,编排链一个字都不用改,也不用重写脚本、换 SDK。这种一句话切换,也是把全套模型收进同一个平台后才有的便利。

不过整条链全用旗舰档也没必要,一个任务里的活本来就有轻有重。改改分镜文字、校验一下格式,小模型足够;真正吃效果的是出关键帧和图生视频这两步,值得用好的。把这个分法提前写成规则交给 Agent,它每一步自己对着选,简单的走便宜档,复杂的走旗舰档,钱花在该花的地方,复杂任务里就可以更加省钱。

模型都在一个平台,所以长程任务能一口气跑完

实测中的编排链能这么跑,是因为模型都在千问 AI 平台上。一百多个系列,开源模型和 Qwen 的闭源商业模型都有,一个 Key、一个兼容协议就能在它们之间切,不用一家家注册账号、存好几个 Key,也不用为每个模型单独搭一套环境。换模型对 Agent 来说就是换个名字。所以它才能从一段故事一路走到成片,中间没停下来问我什么。

四、「Agent 自主控制模型」的两个核心 Skill

千问 AI 平台能让 Agent 自主控制模型,核心是把平台自己的运营动作也开放给 Agent,上线了两个 好用的官方 Skill,正好是一进一出。

先说 qianwen-ai,它 让 Agent 会用平台上的模型,实测使用的都是它。

装上之后,选哪个模型、怎么调用、认证和 API Key 怎么管、这个月花了多少、免费额度还剩多少,都能交给 Agent。你说一句「挑个便宜点 的模型把这批文档翻了」,或者「查下某个模型的免费额度 还剩多少」,它自己就去平台里办。

Image 13: Image
Image 13: Image

而 qianwenai-deploy 是出口,让 Agent 把做出来的应用部署上云。项目写完要上线,在项目目录里说一句「帮我把这个项目部署上云」,它自己分析项目、选方案、给报价,确认后才动手;给它一个 Git 链接也行,会自己克隆、构建。

Image 14: Image
Image 14: Image

改完说「更新项目」就热更新;不想留着,再说一句删掉,资源全部释放、停止计费,整个过程不用进入控制台。

Image 15: Image
Image 15: Image

写在最后:从人调模型,到 Agent 调模型

模型每隔几周换一次榜首,盯着谁最强意义不大。Agent 干一个任务往往要连着调好几个模型,费时间的是在几家之间来回切、重复配置。千问AI 平台把重心放在聚合本身,Qwen、Kimi、DeepSeek 等一百多个系列都接进来,一个 Key 全调得动,选模型、调用、部署还能交给官方 Skill,让 Agent 自己完成。

从人登录控制台操作平台,到给 Agent 下一句指令、让它替你把模型用起来,这是这一两年正在发生的变化。我们这轮从生图到做出一条短片的实测,跑的就是这个方向,看看模型平台怎么真正「为 Agent 而生」。

想体验的话就两步:去 platform.qianwenai.com 注册,把 API Key 配进你常用的编码工具,用注册送的额度先跑跑看。觉得顺手、要高频用,再买 Token Plan 也不迟。

官网:https://www.qianwenai.com/控制台:https://platform.qianwenai.com

Image 16: 图片****

一起“**赞”三连↓**