KDnuggets

Pairing Claude Code with Local Models

8.5内容质量

TL;DR · AI 摘要

本地模型在2026年已足够强大,可替代Claude Code完成代码相关任务,无需依赖第三方API。

核心要点

  • 本地模型可实现零每令牌成本和无速率限制的代码完成、重构、调试。
  • 设置ANTHROPIC_BASE_URL可将Claude Code请求重定向到本地推理服务器。
  • 推荐使用Ollama、LM Studio和llama.cpp作为本地推理后端。

结构提纲

按章节快速跳转。

  1. 本地模型在2026年已足够强大,可替代Claude Code完成代码相关任务。

  2. Claude Code的会话成本高,且受第三方API限制影响。

  3. 本地模型可实现零成本和无速率限制的代码任务处理。

  4. 通过设置ANTHROPIC_BASE_URL可将Claude Code请求重定向到本地推理服务器。

  5. OllamaLM Studiollama.cpp是推荐的本地推理后端。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 本地模型替代Claude Code
    • 优势
      • 零成本
      • 无速率限制
    • 连接方法
      • 设置ANTHROPIC_BASE_URL
    • 推荐后端
      • Ollama
      • LM Studio
      • llama.cpp

金句 / Highlights

值得收藏与分享的关键句。

#Claude Code#本地模型#AI编程#推理后端
打开原文

将 Claude Code 与本地模型结合使用 - KDnuggets

publ: 2026年6月12日

  • 博客热门文章
  • 主题 AI 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
  • 数据集
  • 活动
  • 资源 快速参考指南 推荐 技术简报
  • 广告

加入新闻通讯

#header end

/ad_wrapper

将 Claude Code 与本地模型结合使用

2026年的本地模型已经足够好。对于 Claude Code 每天处理的任务:代码补全、重构、调试、代码库解释;一个选择得当的量化模型在本地运行,可以覆盖绝大多数实际使用案例,且每令牌成本为零,没有速率限制。

作者:

Shittu Olumide

,技术内容专家,2026年6月12日,编程

<div class="addthis_native_toolbox"></div>

# 引言

智能代理编程会话成本很高。一次 Claude Code 会话(读取文件、编写代码、运行测试、迭代)可能消耗的令牌数量是普通聊天对话的10到50倍。在大规模使用时,这会迅速累积。再加上速率限制可能在长时间运行的工作流程中中断会话,以及对第三方 API 的依赖可能随时改变价格、实施更严格的政策或服务器宕机,本地推理的必要性就变得显而易见。

2026年的本地模型已经足够好。对于 Claude Code 每天处理的任务——代码补全、重构、调试、代码库解释——一个选择得当的量化模型在本地运行,可以覆盖绝大多数实际使用案例,且每令牌成本为零,没有速率限制。本文将涵盖三个推理后端(Ollama、LM Studio 和 llama.cpp),将每个后端连接到 Claude Code 所需的确切环境变量和配置文件,一个精选的模型运行表,以及实际遇到问题时的故障排除解决方案。

# Claude Code 如何连接到任何本地模型

机制比大多数指南所描述的要简单得多。Claude Code 以 Anthropic Messages API 格式发送请求。默认情况下,这些请求发送到 Anthropic 的服务器。设置 ANTHROPIC_BASE_URL 可以将这些请求重定向到任何使用相同格式的服务器,现在包括 Ollama、LM Studio 和 llama.cpp。

根据官方 Claude Code 环境变量文档,对于此设置重要的变量包括:

  • ANTHROPIC_BASE_URL:将所有 API 调用从 Anthropic 的服务器重定向到您设置的任何 URL。将其设置为本地推理服务器的地址。ANTHROPIC_API_KEY:在请求头中发送的 API 密钥。本地服务器通常忽略身份验证,因此通常将其设置为占位符字符串,如 "local" 或 "ollama"。ANTHROPIC_AUTH_TOKEN:另一种身份验证头。某些本地服务器会检查此字段而不是 API 密钥。将其设置为相同的占位符。

ANTHROPIC_DEFAULT_SONNET_MODEL、ANTHROPIC_DEFAULT_HAIKU_MODEL 和 ANTHROPIC_DEFAULT_OPUS_MODEL:Claude Code 根据任务的不同内部请求不同的模型层级。这三个变量将每个层级映射到本地模型的名称。如果没有这些变量,Claude Code 会向本地服务器发送请求,请求 claude-sonnet-4-20250514 模型,而本地服务器会拒绝该请求,因为本地没有这样的模型。

2026 年 1 月,Ollama 增加了对 Anthropic Messages API 的原生支持,这一技术变更使得在不使用翻译代理的情况下,该工作流程变得切实可行。LM Studio 在 0.4.1 版本中增加了原生的 /v1/messages 端点。llama.cpp 更早地就支持了 Anthropic API。现在,这三者都可以使用 Claude Code 的原生协议。

一张清晰的架构图,展示了 Claude Code、Ollama、LM Studio 和 llama.cpp | 图片由作者提供

# 后端 1:Ollama

Ollama 是一个理想的起点。它处理模型管理的所有复杂性——下载权重、量化、GPU 和 CPU 分配以及服务——通过一个简单的命令行界面(CLI)。一个命令用于安装,一个命令用于拉取模型,只需几个环境变量即可进行配置。安装后,Ollama 作为后台服务运行,因此不需要手动启动服务器。

前提条件

  • macOS、Linux 或 Windows(Windows 推荐使用 WSL2)
  • 实际使用至少需要 16 GB RAM(推荐 32 GB)
  • GPU 推荐使用 8 GB 以上 VRAM 用于 GPU 推理,或仅使用 CPU 并确保有足够的 RAM
  • 需要 Ollama v0.14.0 或更高版本以支持 Anthropic Messages API

安装 Ollama:

code
# macOS 和 Linux —— 一键安装
curl -fsSL https://ollama.com/install.sh | sh

# 验证版本 —— 必须为 0.14.0+ 才能兼容 Claude Code
ollama version
# 预期输出:
# ollama version is 0.14.x or higher

# Windows:从 https://ollama.com 下载安装程序
# 最近的版本中,原生 Windows 支持已显著改进

安装完成后,Ollama 会自动作为后台服务在端口 11434 上运行。你可以验证它是否正在运行:

code
# 检查 Ollama 服务是否正常运行
curl http://localhost:11434

# 预期响应:
# Ollama is running

拉取一个编码模型:

code
# GLM-4.7-Flash —— 推荐的起点
# 强大的工具调用能力,128K 上下文,适合 8 GB VRAM
# Apache 2.0 许可证
ollama pull glm-4.7-flash:latest

# Qwen3-Coder —— 强大的代码生成和指令遵循能力
# 完整模型需要 20 GB 以上的 VRAM
ollama pull qwen3-coder

# Devstral-Small —— 特别为代理编码工作流程设计
# 社区测试表明其与 Claude Code 兼容
# 24B,需要 16 GB 以上的 VRAM
ollama pull devstral-small-2:24b

# 验证模型是否已下载并准备就绪
ollama list
# 显示所有已拉取的模型及其大小和修改日期

#### // 配置 Claude Code 使用 Ollama

选项 1:Shell 导出(仅当前终端会话)

code
# 将 Claude Code 重定向到本地的 Ollama 服务器
export ANTHROPIC_BASE_URL="http://localhost:11434"

# 本地服务器不需要真实的认证
# 将这些设置为任意非空字符串 —— Ollama 忽略该值
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_AUTH_TOKEN="ollama"

# 将 Claude Code 的模型层级请求映射到本地模型名称
# Claude Code 内部请求 sonnet/haiku/opus —— 这些变量
# 将这些层级名称转换为你本地拉取的模型名称
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"

# 启动 Claude Code —— 它现在将使用 Ollama 而不是 Anthropic API
claude

选项 2:~/.claude/settings.json(永久,适用于所有会话)

此方法可以跨终端重启,并且每次启动 Claude Code 时都会生效。Claude Code 在启动时会从 settings.json 读取环境变量,因此无论以何种方式启动 claude,这些设置都会生效。

创建或编辑 ~/.claude/settings.json:

code
{
  "env": {
    "ANTHROPIC_BASE_URL": "http://localhost:11434",
    "ANTHROPIC_API_KEY": "ollama",
    "ANTHROPIC_AUTH_TOKEN": "ollama",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-4.7-flash:latest",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.7-flash:latest",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-4.7-flash:latest"
  }
}

选项 3:项目目录中的 .env 文件(按项目覆盖)

如果你想让某个特定项目使用不同的模型,同时保持全局的 Anthropic API 设置:

code
# 项目根目录中的 .env 文件 -- 会被 Claude Code 自动加载
ANTHROPIC_BASE_URL=http://localhost:11434
ANTHROPIC_API_KEY=ollama
ANTHROPIC_AUTH_TOKEN=ollama
ANTHROPIC_DEFAULT_SONNET_MODEL=qwen3-coder
ANTHROPIC_DEFAULT_HAIKU_MODEL=qwen3-coder
ANTHROPIC_DEFAULT_OPUS_MODEL=qwen3-coder

验证连接:

code
# 使用一个简单的测试启动 Claude Code
claude

# 在 Claude Code 中运行一个基本提示:
# > 你正在运行哪个模型?
# 本地模型应该在不调用任何 Anthropic API 的情况下作出响应。

# 为了确认没有进行外部调用,使用详细日志启动:
claude --verbose

# 查找显示请求发送到 localhost:11434 的行
# 而不是 api.anthropic.com

从零开始的完整工作流程:

code
curl -fsSL https://ollama.com/install.sh | sh          # 1. 安装 Ollama
ollama pull glm-4.7-flash:latest                       # 2. 拉取模型(约 4 GB)
export ANTHROPIC_BASE_URL="http://localhost:11434"     # 3. 重定向 Claude Code
export ANTHROPIC_API_KEY="ollama"                      # 4. 设置占位符认证
export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"
claude                                                  # 5. 启动

# 后端 2:LM Studio

如果你希望有一个图形界面来浏览和管理模型,而不是完全在终端中操作,LM Studio 是一个不错的选择。从版本 0.4.1 开始,它包含了原生的与 Anthropic 兼容的 /v1/messages 端点 —— 这是 Claude Code 所期望的路径,因此不需要翻译层或代理。

前提条件:

  • 推荐使用 macOS、Windows 或具有 6 GB 以上 VRAM 的 Linux GPU(仅 CPU 也可,但速度较慢)从 lmstudio.ai 下载或使用 CLI 安装器安装无图形界面的服务器

安装和配置 LM Studio:

code
# 在没有 GUI 的服务器或虚拟机上 -- CLI 安装器
curl -fsSL https://releases.lmstudio.ai/cli/install.sh | bash

# 或者从 https://lmstudio.ai 下载桌面应用以使用 GUI

GUI 设置步骤:

  • 打开 LM Studio 并搜索一个编码模型(搜索 "qwen coder" 或 "devstral")。下载模型。LM Studio 会自动处理量化选择。前往本地服务器标签(左侧边栏中的 <> 图标)。设置上下文大小。LM Studio 推荐至少从 25,000 个标记开始,并增加以获得更好的效果。点击启动服务器。注意端口(默认:1234)并精确复制模型名称。

注意:请准确复制模型标识符。LM Studio 显示的是你需要传递给 ANTHROPIC_DEFAULT_SONNET_MODEL 的确切字符串。此处的不匹配是最常见的失败模式。

配置 Claude:

code
# 将基础 URL 设置为 LM Studio 的本地服务器
export ANTHROPIC_BASE_URL="http://localhost:1234"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_AUTH_TOKEN="lm-studio"

# 将模型名称替换为 LM Studio 显示的你加载模型的名称
# 请准确复制它,包括任何版本后缀或量化标签
export ANTHROPIC_DEFAULT_SONNET_MODEL="qwen2.5-coder-32b-instruct"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="qwen2.5-coder-32b-instruct"
export ANTHROPIC_DEFAULT_OPUS_MODEL="qwen2.5-coder-32b-instruct"

或者持久化保存在 ~/.claude/settings.json 中:

code
{
  "env": {
    "ANTHROPIC_BASE_URL": "http://localhost:1234",
    "ANTHROPIC_API_KEY": "lm-studio",
    "ANTHROPIC_AUTH_TOKEN": "lm-studio",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "qwen2.5-coder-32b-instruct",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "qwen2.5-coder-32b-instruct",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "qwen2.5-coder-32b-instruct"
  }
}

如何运行:

code
# 1. 从 GUI 启动 LM Studio 服务器(本地服务器标签 > 启动服务器)
# 2. 设置环境变量
export ANTHROPIC_BASE_URL="http://localhost:1234"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_AUTH_TOKEN="lm-studio"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-model-name-here"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-model-name-here"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-model-name-here"
# 3. 启动
claude

# 后端 3: llama.cpp

当需要直接控制推理参数(如量化类型、KV缓存配置、批处理大小、线程数)时,或者在服务器上运行且希望获得最低开销时,llama.cpp 是最佳选择。它原生支持 Anthropic Messages API,因此不需要代理或翻译层。

  • 一个 GGUF 格式的模型文件(从 Hugging Face 下载;搜索任何模型的 "GGUF" 版本)CUDA 能力 GPU 用于 GPU 推理,或仅 CPU 用于较慢的推理 CMake 和 C++ 编译器用于源代码构建(在 Linux/CUDA 上,建议使用源代码构建)

安装 llama.cpp:

code
# macOS -- Homebrew 是最简单的
brew install llama.cpp

# Linux with CUDA -- 从源代码构建以获得最佳 GPU 性能
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON          # 启用 CUDA 加速
cmake --build build --config Release   # 构建
# 二进制文件在 ./build/bin/

# Linux CPU-only 构建
cmake -B build
cmake --build build --config Release

# Windows -- 可在以下地址找到预构建的二进制文件:
# https://github.com/ggml-org/llama.cpp/releases
# 下载与你的硬件匹配的 CUDA 或 CPU 版本

下载 GGUF 模型:

code
# 如果你还没有安装 Hugging Face CLI,请安装它
pip install huggingface-hub

# 下载 Q4_K_XL 量化版本的 GLM-4.7-Flash(约 4.5 GB)
# 这种量化方式在编码方面提供了良好的大小/质量平衡
huggingface-cli download unsloth/GLM-4.7-Flash-GGUF \
  GLM-4.7-Flash-UD-Q4_K_XL.gguf \
  --local-dir ./models/

# 或者下载 Q4 量化版本的 Qwen3-Coder(约 15 GB 用于 32B)
huggingface-cli download Qwen/Qwen3-Coder-32B-Instruct-GGUF \
  qwen3-coder-32b-instruct-q4_k_m.gguf \
  --local-dir ./models/

启动 llama.cpp 服务器:

code
# 使用 Anthropic API 支持和 128K 上下文窗口启动 llama-server
llama-server \
  --model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
  --alias "glm-4.7-flash" \          # 这个名称会出现在 ANTHROPIC_DEFAULT_SONNET_MODEL 中
  --port 8001 \
  --ctx-size 131072 \                # 128K 上下文窗口 -- 对于大型代码库非常重要
  --flash-attn \                     # 内存高效的注意力机制,提高速度
  --n-gpu-layers 99                  # 将所有层卸载到 GPU;如果仅使用 CPU,请删除此参数

# 仅使用 CPU 进行推理(无 GPU):
llama-server \
  --model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
  --alias "glm-4.7-flash" \
  --port 8001 \
  --ctx-size 32768 \                 # 在 CPU 上减少上下文大小以保持内存可控
  --threads 8                        # 与您的 CPU 核心数匹配

关键参数说明:

  • --alias : Claude Code 在请求中发送的模型名称字符串。将 ANTHROPIC_DEFAULT_SONNET_MODEL 设置为与此完全匹配。--ctx-size : 以 token 为单位的上下文窗口。131072 = 128K。更大的上下文窗口对代码库分析更好,但会使用更多 VRAM。如果遇到内存不足错误,请减少该值。--flash-attn : Flash Attention 通过以更小的块处理注意力来减少峰值 VRAM。只要您的构建支持,请启用此功能。--n-gpu-layers 99 : 将所有变压器层卸载到 GPU。如果 VRAM 紧张,服务器会自动使用更少的层。
code
export ANTHROPIC_BASE_URL="http://localhost:8001"
export ANTHROPIC_API_KEY="llama-cpp"
export ANTHROPIC_AUTH_TOKEN="llama-cpp"

# 必须与传递给 llama-server 的 --alias 完全匹配
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash"
code
# 终端 1:启动 llama.cpp 服务器
llama-server \
  --model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
  --alias "glm-4.7-flash" \
  --port 8001 \
  --ctx-size 131072 \
  --flash-attn \
  --n-gpu-layers 99

# 终端 2:配置并启动 Claude Code
export ANTHROPIC_BASE_URL="http://localhost:8001"
export ANTHROPIC_API_KEY="llama-cpp"
export ANTHROPIC_AUTH_TOKEN="llama-cpp"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash"
claude

# 完整的 settings.json

环境变量导出仅在当前终端会话中有效。为了实现持久配置,请使用 ~/.claude/settings.json。Claude Code 在启动时会从该文件读取变量,因此无论从终端、VS Code 任务还是脚本启动 Claude,这些变量都会生效。

以下是包含所有变量解释的生产就绪 settings.json:

code
{
  "env": {
    "ANTHROPIC_BASE_URL": "http://localhost:11434",

    "ANTHROPIC_API_KEY": "ollama",
    "ANTHROPIC_AUTH_TOKEN": "ollama",

    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-4.7-flash:latest",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.7-flash:latest",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-4.7-flash:latest",

    "CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1"
  }
}

为什么 CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS: "1" 重要:

在通过非Anthropic后端使用Claude Code时,Claude Code会在请求头中添加Anthropic特定的实验性Beta标志——这些标志是第三方和本地服务器无法识别的。这会导致大多数本地推理服务器出现错误:Unexpected value(s) for the anthropic-beta header。将此变量设置为"1"会在请求发出前移除这些头信息,从而消除错误,而不会影响Claude Code的核心功能。

在不同后端之间切换:

如果你使用多个后端——日常使用Ollama,复杂任务使用Anthropic API——最干净的方法是维护独立的shell脚本,而不是来回编辑settings.json:

code
# use-local.sh -- 切换到Ollama
export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"
echo "Claude Code → local Ollama (glm-4.7-flash)"
code
# use-anthropic.sh -- 切换回Anthropic API
unset ANTHROPIC_BASE_URL
unset ANTHROPIC_AUTH_TOKEN
unset ANTHROPIC_DEFAULT_SONNET_MODEL
unset ANTHROPIC_DEFAULT_HAIKU_MODEL
unset ANTHROPIC_DEFAULT_OPUS_MODEL
# ANTHROPIC_API_KEY 应该已经在你的rc文件中设置为真实的密钥
echo "Claude Code → Anthropic API"

在当前会话中运行其中一个脚本:

code
source ./use-local.sh
claude

# 当你需要真实API处理复杂任务时:
source ./use-anthropic.sh
claude

# 2026年Claude Code的最佳本地模型

硬件是主要的限制因素。对于Claude Code使用本地模型进行编码任务,而不是仅仅作为演示,应目标为32 GB的RAM——Apple Silicon统一内存或PC RAM。使用较小的量化模型和CPU卸载,16 GB也是可行的,但生成速度在多步骤代理任务上会明显变慢。

模型

所需VRAM

上下文

优势

许可证

拉取命令

glm-4.7-flash

8 GB

128K

工具调用,快速,低VRAM

Apache 2.0

code
ollama pull glm-4.7-flash

devstral-small-2:24b

16 GB

32K

代理编码工作流

code
ollama pull devstral-small-2:24b

qwen3-coder

20 GB

代码生成,指令

code
ollama pull qwen3-coder

qwen3.5:27b

256K

全能性强,大上下文

code
ollama pull qwen3.5:27b

gemma4:26b

推理,77%编码基准

Gemma License

code
ollama pull gemma4:26b

# 常见问题排查

  • 启动Claude Code时连接被拒绝:推理服务器未运行。这是最常见的问题,也是最容易诊断的。 # 检查Ollama是否正在运行 curl http://localhost:11434 # 预期结果:"Ollama is running" # 检查LM Studio服务器是否正在运行 curl http://localhost:1234/v1/models # 应返回加载模型的JSON列表 # 检查llama-server是否正在运行 curl http://localhost:8001/health # 应返回 {"status":"ok"} # 如果未运行——先启动服务器,然后再启动Claude Code ollama serve # Ollama # LM Studio:使用GUI本地服务器标签 # llama.cpp:从后端3部分运行llama-server命令
  • 模型未找到或未知模型错误:ANTHROPIC_DEFAULT_SONNET_MODEL 中的模型名称与服务器所知道的不匹配。 # 列出 Ollama 所有可用模型 ollama list # ANTHROPIC_DEFAULT_SONNET_MODEL 中的模型名称必须完全匹配 # 包括标签 -- "glm-4.7-flash:latest" 而不是 "glm-4.7-flash" # 通过直接 API 调用确认服务器看到的内容 curl http://localhost:11434/v1/models
  • 工具调用失败或返回错误:对于流式工具调用,Claude Code 在执行函数或脚本时会使用,需要 Ollama 0.14.3-rc1 或更高版本。0.14.x 系列的早期版本对流式工具调用的支持不完整。 # 检查你的 Ollama 版本 ollama version # 如果低于 0.14.3,更新 Ollama curl -fsSL https://ollama.com/install.sh | sh
  • anthropic-beta 头错误:你会看到:错误:anthropic-beta 头的值意外。这是因为 Claude Code 添加了本地服务器无法识别的 Anthropic 特定实验性 beta 标志。通过在 settings.jsonenv 块中添加以下内容来修复:"CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1"
  • 恢复到 Anthropic API: # Shell 会话 -- 取消重定向变量 unset ANTHROPIC_BASE_URL unset ANTHROPIC_AUTH_TOKEN unset ANTHROPIC_DEFAULT_SONNET_MODEL unset ANTHROPIC_DEFAULT_HAIKU_MODEL unset ANTHROPIC_DEFAULT_OPUS_MODEL # 然后确保你的真实 API 密钥已设置 echo $ANTHROPIC_API_KEY # 应该显示你的 sk-ant-... 密钥,而不是占位符 # 如果你使用了 settings.json -- 删除或注释掉 env 块 # 并重新启动 Claude Code
  • 生成速度慢:对于代理式 Claude Code 任务,生成速度很重要,因为每个工具调用都是一次往返。如果速度不够:切换到更小或更激进量化模型(Q4_K_M 而不是 Q8)。如果尚未设置,启用 llama.cpp 中的 --flash-attn。减少上下文大小(--ctx-size);更大的上下文预填充速度更慢。在 Ollama 上,将 OLLAMA_NUM_GPU_LAYERS=99 添加到你的环境变量中,以强制最大 GPU 卸载。

# 结论

过去需要脆弱的适配器和技巧才能完成的事情,现在只需五步即可完成。安装推理后端,拉取一个模型,设置三个环境变量,Claude Code 就会路由到你的本地机器,而不是 Anthropic 的 API。一旦你下载了模型,配置过程不到五分钟。

实际的结果是一个在设置后运行成本为零的编码助手,没有速率限制,完全在你的机器上保存代码,并且在质量水平上覆盖了绝大多数实际编码使用案例,这些质量水平在一年前的本地模型中是无法实现的。从 Ollama 和 glm-4.7-flash 开始,它对硬件的要求最低,工具调用支持最一致,并且是通往工作设置最快的路径。一旦它运行起来,根据你的硬件和实际需要的质量级别,再扩展模型。

Shittu Olumide 是一位软件工程师和技术作家,热衷于利用前沿技术创作引人入胜的故事,对细节有敏锐的眼光,擅长简化复杂概念。你也可以在 Twitter 上找到 Shittu。

更多关于此主题的内容

  • 节俭的本地代理编程:Claude Code + Ollama + Gemma4
  • Claude Code 高效技巧
  • 10 个 GitHub 仓库掌握 Claude Code
  • 7 种实用方法减少 Claude Code 的 Token 使用量
  • 使用 Claude Code 的 5 个有趣项目
  • 如何本地设置 Claude Code 通道

<hr class="grey-line"><br> <div><h3>我们推荐的前5门免费课程</h3><br> </div>

Mailchimp for WordPress v4.13.0 - https://wordpress.org/plugins/mailchimp-for-wp/

/ Mailchimp for WordPress 插件

你可以从此处开始编辑。

如果评论已关闭。

<= 上一篇

#content end

<script type="text/javascript">kda_sid_write(kda_sid_n);</script>

最新文章

  • 将 Claude Code 与本地模型结合使用 3 个 NumPy 技巧提升数值性能 从零开始构建特征存储:一个最小可行实现 为你的创业点子获取资金的 7 种最佳方式 低成本实现本地代理编程:Claude Code + Ollama + Gemma4 自动化无聊 PDF 任务的 5 个有用 Python 脚本

热门文章

  • Anthropic 完整指南:Claude 技能构建
  • 自动化无聊 PDF 任务的 5 个有用 Python 脚本
  • 将 Claude Code 与本地模型结合使用
  • AI 工程师必须掌握的 5 个 Python 概念
  • 为你的创业点子获取资金的 7 种最佳方式
  • 用于 Python Web 开发的 10 个 GitHub 仓库
  • 5 篇有趣论文清晰解释了大型语言模型
  • 代理时代对数据科学的意义
  • 用于现代数据库系统和工具的 10 个 GitHub 仓库

#content_wrapper end

© 2026

Guiding Tech Media

|

关于

联系我们

广告合作

隐私政策

服务条款

发布于 2026 年 6 月 12 日,作者是 Olumide Shittu

blank

不,谢谢!

/.main_wrapper

<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>

noptimize

/noptimize