MLflow Blog

Route Claude Code Through MLflow AI Gateway

8.5内容质量
Route Claude Code Through MLflow AI Gateway

TL;DR · AI 摘要

MLflow 3.12.0新增AI Gateway功能,可无缝集成Claude Code,实现请求追踪、预算控制和内容策略管理。

核心要点

  • 通过设置两个环境变量即可实现Claude Code与MLflow的集成,无需修改应用代码
  • 所有请求自动转换为MLflow跟踪,包含提示、响应、令牌计数和延迟等详细信息
  • 预算控制支持全局或工作区级阈值设置,可配置警报和硬限制防止资源超支

结构提纲

按章节快速跳转。

  1. 介绍AI编码代理的普及及MLflow AI Gateway的解决方案

  2. MLflow AI Gateway作为中介实现请求追踪和治理

  3. 分三步设置MLflow服务器、创建端点和配置环境变量

  4. 自动捕获所有请求为MLflow跟踪,无需代码更改

  5. 设置全局或工作区级预算阈值,防止资源超支

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • MLflow AI Gateway集成Claude Code
    • 工作原理
      • 请求中介与追踪
    • 核心功能
      • 可观测性
      • 预算控制
    • 集成步骤
      • 环境变量配置

金句 / Highlights

值得收藏与分享的关键句。

#MLflow#Claude Code#AI Gateway#预算控制#可观测性
打开原文

通过 MLflow AI 网关路由 Claude Code | MLflow

通过 MLflow AI 网关路由 Claude Code

2026 年 5 月 25 日

·

5 分钟阅读

Tomu Hirata

Databricks 软件工程师

Claude Code 这样的 AI 编码代理正成为开发工作流程中的标准组成部分。一个代理在处理复杂任务、理解代码库、编写测试、修复漏洞时,单次会话中可能需要进行数十甚至数百次 LLM 调用。这种程度的自主性非常强大,但它也带来了单次提示不会出现的问题:这要花费多少成本?代理实际发送给模型的内容是什么?我们能否在每个会话中强制执行内容策略?

MLflow AI 网关可以解决这三个问题。从 MLflow 3.12.0 开始,您可以通过两个环境变量将 Claude Code 路由到网关,每个会话立即获得完整的请求追踪、预算控制和防护措施,无需修改应用程序代码。

工作原理

MLflow AI 网关位于 Claude Code 和 Anthropic API 之间。从 Claude Code 的角度来看,一切保持不变,它仍然以相同的方式进行身份验证。从网关的角度来看,每个请求都是一个可追踪、可治理的事件。

这种直通设计意味着您可以在不进行集中式密钥管理的情况下获得集中式可见性:每个开发人员保留自己的 Anthropic 凭据,网关在之上添加治理功能。

集成设置

设置分为三个步骤:启动 MLflow 服务器、创建端点、设置两个环境变量。

步骤 1:启动 MLflow 服务器

code
pip install mlflow
mlflow server --port 5000

步骤 2:创建 Anthropic 端点

在浏览器中打开 MLflow UI(http://localhost:5000/#/gateway),导航到 AI Gateway。点击 Claude Code 图标并进行配置:

步骤 3:将 Claude Code 指向网关

在您的 shell 中设置两个环境变量:

code
export ANTHROPIC_BASE_URL="http://localhost:5000/gateway/proxy/claude-code"

完成。像往常一样运行 claude。所有请求现在都将通过网关。

可观测性:每个请求作为追踪

最直接的好处是可见性。Claude Code 的每次调用,无论会话长度或代理采取多少次交互,都会自动作为 MLflow 追踪记录下来。无需任何仪器化、无需导入 SDK、无需代码更改。

在 MLflow UI 中打开 Traces 标签页,查看所有请求的时间线:提示、响应、令牌计数和延迟,按会话组织。

点击任何追踪,查看详细信息,了解确切发送和接收的内容:

这种级别的详细信息对于理解长期运行的代理会话实际执行了什么操作、哪些子任务消耗了最多的令牌、延迟峰值出现在哪里以及提示在交互中如何演变特别有用。

预算控制:控制支出

编码代理被设计为自主工作,这使得它们容易被遗忘且容易超支。MLflow AI 网关的预算策略允许您全局或按工作区设置支出阈值,配有可配置的警报和硬性限制。

当会话接近阈值时,网关会发送警报。当达到硬性限制时,进一步的请求在到达模型之前会被拒绝,从而在账单到达之前就阻止了失控的成本。

有关配置细节,请参阅预算策略文档。

防护措施:在每个会话中强制执行策略

由于每个 Claude Code 请求都会经过网关,防护措施统一适用,无需针对每个应用程序进行配置。在请求到达 Anthropic 之前,防护措施可以筛选提示注入或受限主题。在响应返回后,可以在代理看到输出前过滤有毒内容或清除 PII 信息。

例如,"Before" 阶段的 PII 防护措施会阻止任何包含电子邮件地址或电话号码等个人数据的请求,并返回包含原因的结构化错误信息,让调用者清楚了解被阻止的具体原因。

请参阅防护措施博客文章,了解防护措施类型、配置以及阻止与清理操作的完整说明。

入门指南

此处描述的所有内容均随 MLflow 一起提供。请遵循 Claude Code 的 AI 网关文档获取完整设置说明,或直接跳转至 OpenAI Codex 和 Gemini CLI(如果您使用这些工具)。

通过 MLflow AI 网关路由 Claude Code 是为自主编码会话添加可观测性和治理的最快方式。它将防护措施和预算策略作为 MLflow AI 网关内置治理层的一部分进行整合。如果遇到问题或有反馈意见,请在 MLflow 的 GitHub Issues 上提交报告。

⭐ 在 GitHub 上给我们点赞,支持这个项目!