Milvus(@milvusio)

When 𝗞𝗶𝗺𝗶 𝗞𝟯 came out, we tested it right away. This is our experimental sharing: Kimi K3 has...

8.5内容质量
When 𝗞𝗶𝗺𝗶 𝗞𝟯 came out, we tested it right away. This is our experimental sharing:

Kimi K3 has...

TL;DR · AI 摘要

Milvus团队测试Kimi K3后发现其强大但成本高,引入claude-context降低40% token消耗。

核心要点

  • Kimi K3拥有2.8T参数和1M-token上下文窗口,但单次输出成本达$15/MTok。
  • Claude-Context通过语义搜索减少40% token使用,保持同等检索质量。
  • 营销团队用K3一天完成活动页原型,但需优化成本结构才能持续使用。

结构提纲

按章节快速跳转。

  1. Milvus团队第一时间测试Kimi K3并分享实验结果。

  2. 2.8T参数、1M-token上下文、视觉理解与代码代理能力。

  3. 营销团队用K3一天完成活动页原型设计验证。

  4. 大模型处理代码库时产生高额token费用(输出$15/MTok)。

  5. 引入Claude-Context通过语义搜索降低40% token消耗。

  6. K3能力与Claude-Context成本优化形成协同效应。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Kimi K3测试与优化
    • 模型特性
      • 2.8T参数
      • 1M-token上下文
      • 代码代理能力
    • 应用验证
      • 营销原型开发
      • 成本超预期
    • 优化方案
      • 引入Claude-Context
      • 语义搜索降低40% token消耗

金句 / Highlights

值得收藏与分享的关键句。

#Kimi K3#代码代理#token成本优化#Milvus#Claude-Context
打开原文

Milvus on X: "当 𝗞𝗶𝗺𝗶 𝗞𝟯 发布时,我们立即进行了测试。这是我们的实验分享:Kimi K3 拥有 2.8 万亿参数、100 万 tokens 的上下文窗口、原生视觉理解能力以及强大的代码代理评分。经过几次内部测试后,我们决定将部分工作流程从 Fable 迁移到 K3。第一个惊喜来自市场团队。一位市场同事用 K3 在一个下午就完成了活动落地页的原型设计。虽然尚未达到生产就绪状态,但足以在工程介入前对齐创意方向。这是积极的一面。不太有趣的部分是 token 费用。大上下文代码代理仅在仓库中定位文件位置就可能消耗大量 tokens。Kimi 的计费规则清晰可见:缓存命中输入费用为 0.30 美元/百万 tokens,缓存未命中输入费用为 3.00 美元/百万 tokens,输出费用为 15.00 美元/百万 tokens。因此我们引入了 𝗰𝗹𝗮𝘂𝗱𝗲-𝗰𝗼𝗻𝘁𝗲𝘅𝘁。它为代码代理提供语义代码搜索,使代理能够检索相关文件和代码片段,而非将整个目录加载到提示词中。在我们的受控评估中,Claude Context MCP 在保持同等检索质量的前提下,将 tokens 使用量减少了约 40%。K3 提升了代理的能力,而 claude-context 使将这种能力精准应用于正确代码的成本大幅降低。GitHub: https://t.co/yyWCfHbgZv" / X

Milvus

@milvusio

当 𝗞𝗶𝗺𝗶 𝗞𝟯 发布时,我们立即进行了测试。这是我们的实验分享:Kimi K3 拥有 2.8 万亿参数、100 万 tokens 的上下文窗口、原生视觉理解能力以及强大的代码代理评分。经过几次内部测试后,我们决定将部分工作流程从 Fable 迁移到 K3。第一个惊喜来自市场团队。一位市场同事用 K3 在一个下午就完成了活动落地页的原型设计。虽然尚未达到生产就绪状态,但足以在工程介入前对齐创意方向。这是积极的一面。不太有趣的部分是 token 费用。大上下文代码代理仅在仓库中定位文件位置就可能消耗大量 tokens。Kimi 的计费规则清晰可见:缓存命中输入费用为 0.30 美元/百万 tokens,缓存未命中输入费用为 3.00 美元/百万 tokens,输出费用为 15.00 美元/百万 tokens。因此我们引入了 𝗰𝗹𝗮𝘂𝗱𝗲-𝗰𝗼𝗻𝘁𝗲𝘅𝘁。它为代码代理提供语义代码搜索,使代理能够检索相关文件和代码片段,而非将整个目录加载到提示词中。在我们的受控评估中,Claude Context MCP 在保持同等检索质量的前提下,将 tokens 使用量减少了约 40%。K3 提升了代理的能力,而 claude-context 使将这种能力精准应用于正确代码的成本大幅降低。GitHub:

github.com/zilliztech/cla…

3:00 PM · Jul 21, 2026

205

Views

3

1