Meet E-Commerce Bench, a new benchmark for long-horizon autonomous business operations. 🚀 Agents s...
E-Commerce Bench 是阿里巴巴推出的全新基准,用于评估长期自主电商运营的智能体,涵盖真实经济因素和多维评估体系。
入选理由:E-Commerce Bench 包含 6886 个产品和 576 个供应商,模拟真实电商环境。
模型
别名:通义千问
被微调的开源大语言模型
已跟踪 30 条高相关材料
最近变化
2026-09-03 · QwenCloud已上线,提供模型服务
为什么值得关注
Qwen 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Meet E-Commerce Bench, a new benchmark for long-horizon autonomous business operations. 🚀 Agents s...
Qwen(@Alibaba_Qwen) · 8.5 分
E-Commerce Bench 是阿里巴巴推出的全新基准,用于评估长期自主电商运营的智能体,涵盖真实经济因素和多维评估体系。
Our partners @LangChain generate billions of tokens of agent traces a day, their richest signal on h...
Fireworks AI(@FireworksAI_HQ) · 8.5 分
Fireworks AI通过微调Qwen模型帮助LangChain实现评估成本降低100倍,替代GPT-5.5等闭源模型。
A secret that leaks into shipped code is a breach waiting to happen. @FactoryAI's droids write and...
Fireworks AI(@FireworksAI_HQ) · 8.5 分
FactoryAI通过微调Qwen模型,使Droid Shield在代码审查中比GPT-5.5多捕捉20%的真实秘密,同时降低成本和延迟。
已收录 30 条与 Qwen 相关的内容,按评分排序。
E-Commerce Bench 是阿里巴巴推出的全新基准,用于评估长期自主电商运营的智能体,涵盖真实经济因素和多维评估体系。
入选理由:E-Commerce Bench 包含 6886 个产品和 576 个供应商,模拟真实电商环境。
FactoryAI通过微调Qwen模型,使Droid Shield在代码审查中比GPT-5.5多捕捉20%的真实秘密,同时降低成本和延迟。
入选理由:使用Training API微调Qwen模型可提升20%的敏感信息检测率
Fireworks AI通过微调Qwen模型帮助LangChain实现评估成本降低100倍,替代GPT-5.5等闭源模型。
入选理由:微调Qwen模型可替代GPT-5.5实现100倍成本降低
中国开源模型正成为西方AI公司的重要依赖,但这也带来结构性风险。Qwen市场份额激增,蒸馏技术加剧中美模型差距。
入选理由:Qwen在2024年1月至2026年2月间占据69%的开源模型微调市场份额
NVIDIA推出的NeMo Tron 3.5 Lightning模型专为代理执行层优化,实现4倍吞吐量,显著降低推理成本。
入选理由:NeMo Tron 3.5 Lightning是NVIDIA推出的30B参数MoE模型,专为执行层任务设计
通义千问推出Qwen3.8-Flash模型,开放权重并提供API服务,参数达125B,输入输出价格分别为0.16和0.47美元/百万令牌。
入选理由:Qwen3.8-Flash参数规模达125B,N-gram达51B,支持多模态任务
前沿AI实验室通过状态持久性和专有执行环境构建开发者锁定,影响开放系统开发。
入选理由:OpenAI GPT-5.6 Sol通过状态持久性使ARC-AGI-3得分提升3倍
真正的AI护城河在于数据、工程和基础设施,而非架构创新。卡内基梅隆大学教授Russ Salakhutdinov预测AGI短期内难以实现,模型竞争将转向产品化,预测系统可能取代传统咨询。
入选理由:AGI短期内无法实现,核心突破在数据和工程而非架构
中国开源模型已占据西方AI公司训练栈核心位置,蒸馏技术加剧中美模型能力差距,西方需独立构建或接受滞后学习。
入选理由:Qwen在2024-2026年占据69%西方公司模型微调市场份额
本地运行AI模型在隐私、成本、离线和所有权方面具有显著优势,且Qwen在测试中表现突出。
入选理由:本地模型无需云端依赖,数据完全私有且无使用成本。
提示工程和上下文工程能显著提升AI代理性能,通过优化输入和上下文信息。
入选理由:使用LangChain v1和Ollama可本地运行AI代理,避免API成本
Qwen-Image-3.0通过‘Real’三大维度提升图像生成能力,支持复杂布局、高精度细节及多语言艺术风格,适用于设计、教育等多领域。
入选理由:支持4.5k token提示词,可生成报纸、故事板等复杂布局
Ramp Router通过动态模型路由显著降低AI成本,成为LLM堆栈核心组件。
入选理由:模型路由可降低30%以上推理成本
大模型参数规模突破T级得益于新型架构如Gated Delta Networks和Mamba的创新,英伟达、Kimi、Qwen等均采用混合架构优化性能。
入选理由:Gated Delta Networks基于Mamba思想,提升模型效率。
Qwen 3.8 Max发布,2.4万亿参数且开放权重,测试表现接近Fable 5,可通过Token Plan立即使用。
入选理由:Qwen 3.8 Max拥有2.4万亿参数,是目前参数量最大的开源模型之一。
Dify平台推出Qubrid AI插件,通过单一API密钥集成DeepSeek、Kimi等多模型,解决AI应用开发中频繁切换模型的痛点。
入选理由:Qubrid AI插件支持DeepSeek、Kimi、Qwen等6大模型的一站式接入
本文提供本地化AI代理评估框架,结合LLM作为裁判与规则检查,使用LangChain、Ollama等工具实现零API成本测试。
入选理由:使用LLM-as-a-judge与规则检查双重机制评估AI代理输出
Qwen-Image-3.0已在OpenArt上线,支持多语言文本和高精度图像生成。
入选理由:Qwen-Image-3.0支持12种语言原生文本渲染
开源AI迎来重大进展,Kimi K3和Qwen等模型加速发布,推动AI基础设施变革。
入选理由:开源模型的快速发布正在改变AI基础设施的竞争格局
Qwen-Image-3.0通过真实性、内容丰富性和知识深度升级,实现报纸PDF、UI设计等高价值场景的图像生成突破。
入选理由:Qwen-Image-3.0聚焦'真实性'升级,支持复杂UI和短剧分镜生成
2026年开源模型趋势显示,小模型仍主导实际应用,Qwen和Gemma在本地推理中表现突出,AI代理成为Hugging Face Hub的重要力量。
入选理由:Qwen在本地推理性能上领先于Gemma
Qwen-MM-Plugins扩展了代理的多模态能力,支持图像、视频、3D/CAD处理及文档编辑,但缺乏技术细节和原理说明。
入选理由:Qwen-MM-Plugins支持图像、视频、文档和3D/CAD处理
本文汇总了近期AI和科技行业动态,但缺乏技术深度,更多是新闻资讯性质。
入选理由:Codex推出重置套餐,DeepSeek采用峰谷调价策略
文章宣布Qwen3.8-27B模型开放权重但缺乏技术细节,主要以日本花园比喻描述模型特性。
入选理由:Qwen3.8-27B模型权重将于本周开放
Fable在世界杯预测中表现优于其他主流LLM,但文章缺乏技术细节。
入选理由:Fable准确预测法国队出局及决赛双方,而ChatGPT/Qwen/Kimi仅猜对一方
Simon Willison 对即将发布的 Qwen 3.8 模型表达期待,Qwen Developers 宣布新模型参数量达 27B。
入选理由:Qwen 3.8 模型参数量达到 27B
2026年AI领域关键人物和团队列表,涵盖OpenAI、DeepMind及中国开源模型等。
入选理由:OpenAI、DeepMind、Anthropic CEO被列为前沿实验室创始人
文章为QwenCloud的宣传推文,缺乏技术深度和实用信息,仅包含产品发布信息和用户互动内容。
入选理由:QwenCloud已上线,提供模型服务
Qwen3.8-Max在Legal Research Bench排名从第22位跃升至第4位,三个月内分数几乎翻倍。
入选理由:Qwen3.8-Max在Legal Research Bench排名提升18位,从#22到#4
阿里云发布Qwen3.8-Max-Preview模型,参数量达2.4T,宣称在编码和协作能力上有显著提升,当前价格折扣达98%。
入选理由:Qwen3.8-Max-Preview模型参数量达2.4T,是当前发布的最大规模模型。