Pairing Claude Code with Local Models
TL;DR · AI 摘要
本地模型在2026年已足够强大,可替代Claude Code完成代码相关任务,无需依赖第三方API。
核心要点
- 本地模型可实现零每令牌成本和无速率限制的代码完成、重构、调试。
- 设置ANTHROPIC_BASE_URL可将Claude Code请求重定向到本地推理服务器。
- 推荐使用Ollama、LM Studio和llama.cpp作为本地推理后端。
结构提纲
按章节快速跳转。
- §引言
本地模型在2026年已足够强大,可替代Claude Code完成代码相关任务。
Claude Code的会话成本高,且受第三方API限制影响。
本地模型可实现零成本和无速率限制的代码任务处理。
通过设置ANTHROPIC_BASE_URL可将Claude Code请求重定向到本地推理服务器。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 本地模型替代Claude Code
- 优势
- 零成本
- 无速率限制
- 连接方法
- 设置ANTHROPIC_BASE_URL
- 推荐后端
- Ollama
- LM Studio
- llama.cpp
金句 / Highlights
值得收藏与分享的关键句。
本地模型在2026年已足够强大,可替代Claude Code完成代码相关任务。
设置ANTHROPIC_BASE_URL可将Claude Code请求重定向到本地推理服务器。
推荐使用Ollama、LM Studio和llama.cpp作为本地推理后端。
将 Claude Code 与本地模型结合使用 - KDnuggets
publ: 2026年6月12日
- 博客热门文章
- 主题 AI 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
- 数据集
- 活动
- 资源 快速参考指南 推荐 技术简报
- 广告
加入新闻通讯
#header end
/ad_wrapper
将 Claude Code 与本地模型结合使用
2026年的本地模型已经足够好。对于 Claude Code 每天处理的任务:代码补全、重构、调试、代码库解释;一个选择得当的量化模型在本地运行,可以覆盖绝大多数实际使用案例,且每令牌成本为零,没有速率限制。
作者:
Shittu Olumide
,技术内容专家,2026年6月12日,编程
<div class="addthis_native_toolbox"></div>
# 引言
智能代理编程会话成本很高。一次 Claude Code 会话(读取文件、编写代码、运行测试、迭代)可能消耗的令牌数量是普通聊天对话的10到50倍。在大规模使用时,这会迅速累积。再加上速率限制可能在长时间运行的工作流程中中断会话,以及对第三方 API 的依赖可能随时改变价格、实施更严格的政策或服务器宕机,本地推理的必要性就变得显而易见。
2026年的本地模型已经足够好。对于 Claude Code 每天处理的任务——代码补全、重构、调试、代码库解释——一个选择得当的量化模型在本地运行,可以覆盖绝大多数实际使用案例,且每令牌成本为零,没有速率限制。本文将涵盖三个推理后端(Ollama、LM Studio 和 llama.cpp),将每个后端连接到 Claude Code 所需的确切环境变量和配置文件,一个精选的模型运行表,以及实际遇到问题时的故障排除解决方案。
# Claude Code 如何连接到任何本地模型
机制比大多数指南所描述的要简单得多。Claude Code 以 Anthropic Messages API 格式发送请求。默认情况下,这些请求发送到 Anthropic 的服务器。设置 ANTHROPIC_BASE_URL 可以将这些请求重定向到任何使用相同格式的服务器,现在包括 Ollama、LM Studio 和 llama.cpp。
根据官方 Claude Code 环境变量文档,对于此设置重要的变量包括:
- ANTHROPIC_BASE_URL:将所有 API 调用从 Anthropic 的服务器重定向到您设置的任何 URL。将其设置为本地推理服务器的地址。ANTHROPIC_API_KEY:在请求头中发送的 API 密钥。本地服务器通常忽略身份验证,因此通常将其设置为占位符字符串,如 "local" 或 "ollama"。ANTHROPIC_AUTH_TOKEN:另一种身份验证头。某些本地服务器会检查此字段而不是 API 密钥。将其设置为相同的占位符。
ANTHROPIC_DEFAULT_SONNET_MODEL、ANTHROPIC_DEFAULT_HAIKU_MODEL 和 ANTHROPIC_DEFAULT_OPUS_MODEL:Claude Code 根据任务的不同内部请求不同的模型层级。这三个变量将每个层级映射到本地模型的名称。如果没有这些变量,Claude Code 会向本地服务器发送请求,请求 claude-sonnet-4-20250514 模型,而本地服务器会拒绝该请求,因为本地没有这样的模型。
2026 年 1 月,Ollama 增加了对 Anthropic Messages API 的原生支持,这一技术变更使得在不使用翻译代理的情况下,该工作流程变得切实可行。LM Studio 在 0.4.1 版本中增加了原生的 /v1/messages 端点。llama.cpp 更早地就支持了 Anthropic API。现在,这三者都可以使用 Claude Code 的原生协议。
一张清晰的架构图,展示了 Claude Code、Ollama、LM Studio 和 llama.cpp | 图片由作者提供
# 后端 1:Ollama
Ollama 是一个理想的起点。它处理模型管理的所有复杂性——下载权重、量化、GPU 和 CPU 分配以及服务——通过一个简单的命令行界面(CLI)。一个命令用于安装,一个命令用于拉取模型,只需几个环境变量即可进行配置。安装后,Ollama 作为后台服务运行,因此不需要手动启动服务器。
前提条件
- macOS、Linux 或 Windows(Windows 推荐使用 WSL2)
- 实际使用至少需要 16 GB RAM(推荐 32 GB)
- GPU 推荐使用 8 GB 以上 VRAM 用于 GPU 推理,或仅使用 CPU 并确保有足够的 RAM
- 需要 Ollama v0.14.0 或更高版本以支持 Anthropic Messages API
安装 Ollama:
# macOS 和 Linux —— 一键安装
curl -fsSL https://ollama.com/install.sh | sh
# 验证版本 —— 必须为 0.14.0+ 才能兼容 Claude Code
ollama version
# 预期输出:
# ollama version is 0.14.x or higher
# Windows:从 https://ollama.com 下载安装程序
# 最近的版本中,原生 Windows 支持已显著改进安装完成后,Ollama 会自动作为后台服务在端口 11434 上运行。你可以验证它是否正在运行:
# 检查 Ollama 服务是否正常运行
curl http://localhost:11434
# 预期响应:
# Ollama is running拉取一个编码模型:
# GLM-4.7-Flash —— 推荐的起点
# 强大的工具调用能力,128K 上下文,适合 8 GB VRAM
# Apache 2.0 许可证
ollama pull glm-4.7-flash:latest
# Qwen3-Coder —— 强大的代码生成和指令遵循能力
# 完整模型需要 20 GB 以上的 VRAM
ollama pull qwen3-coder
# Devstral-Small —— 特别为代理编码工作流程设计
# 社区测试表明其与 Claude Code 兼容
# 24B,需要 16 GB 以上的 VRAM
ollama pull devstral-small-2:24b
# 验证模型是否已下载并准备就绪
ollama list
# 显示所有已拉取的模型及其大小和修改日期#### // 配置 Claude Code 使用 Ollama
选项 1:Shell 导出(仅当前终端会话)
# 将 Claude Code 重定向到本地的 Ollama 服务器
export ANTHROPIC_BASE_URL="http://localhost:11434"
# 本地服务器不需要真实的认证
# 将这些设置为任意非空字符串 —— Ollama 忽略该值
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_AUTH_TOKEN="ollama"
# 将 Claude Code 的模型层级请求映射到本地模型名称
# Claude Code 内部请求 sonnet/haiku/opus —— 这些变量
# 将这些层级名称转换为你本地拉取的模型名称
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"
# 启动 Claude Code —— 它现在将使用 Ollama 而不是 Anthropic API
claude选项 2:~/.claude/settings.json(永久,适用于所有会话)
此方法可以跨终端重启,并且每次启动 Claude Code 时都会生效。Claude Code 在启动时会从 settings.json 读取环境变量,因此无论以何种方式启动 claude,这些设置都会生效。
创建或编辑 ~/.claude/settings.json:
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_API_KEY": "ollama",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-4.7-flash:latest",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.7-flash:latest",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-4.7-flash:latest"
}
}选项 3:项目目录中的 .env 文件(按项目覆盖)
如果你想让某个特定项目使用不同的模型,同时保持全局的 Anthropic API 设置:
# 项目根目录中的 .env 文件 -- 会被 Claude Code 自动加载
ANTHROPIC_BASE_URL=http://localhost:11434
ANTHROPIC_API_KEY=ollama
ANTHROPIC_AUTH_TOKEN=ollama
ANTHROPIC_DEFAULT_SONNET_MODEL=qwen3-coder
ANTHROPIC_DEFAULT_HAIKU_MODEL=qwen3-coder
ANTHROPIC_DEFAULT_OPUS_MODEL=qwen3-coder验证连接:
# 使用一个简单的测试启动 Claude Code
claude
# 在 Claude Code 中运行一个基本提示:
# > 你正在运行哪个模型?
# 本地模型应该在不调用任何 Anthropic API 的情况下作出响应。
# 为了确认没有进行外部调用,使用详细日志启动:
claude --verbose
# 查找显示请求发送到 localhost:11434 的行
# 而不是 api.anthropic.com从零开始的完整工作流程:
curl -fsSL https://ollama.com/install.sh | sh # 1. 安装 Ollama
ollama pull glm-4.7-flash:latest # 2. 拉取模型(约 4 GB)
export ANTHROPIC_BASE_URL="http://localhost:11434" # 3. 重定向 Claude Code
export ANTHROPIC_API_KEY="ollama" # 4. 设置占位符认证
export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"
claude # 5. 启动# 后端 2:LM Studio
如果你希望有一个图形界面来浏览和管理模型,而不是完全在终端中操作,LM Studio 是一个不错的选择。从版本 0.4.1 开始,它包含了原生的与 Anthropic 兼容的 /v1/messages 端点 —— 这是 Claude Code 所期望的路径,因此不需要翻译层或代理。
前提条件:
- 推荐使用 macOS、Windows 或具有 6 GB 以上 VRAM 的 Linux GPU(仅 CPU 也可,但速度较慢)从 lmstudio.ai 下载或使用 CLI 安装器安装无图形界面的服务器
安装和配置 LM Studio:
# 在没有 GUI 的服务器或虚拟机上 -- CLI 安装器
curl -fsSL https://releases.lmstudio.ai/cli/install.sh | bash
# 或者从 https://lmstudio.ai 下载桌面应用以使用 GUIGUI 设置步骤:
- 打开 LM Studio 并搜索一个编码模型(搜索 "qwen coder" 或 "devstral")。下载模型。LM Studio 会自动处理量化选择。前往本地服务器标签(左侧边栏中的 <> 图标)。设置上下文大小。LM Studio 推荐至少从 25,000 个标记开始,并增加以获得更好的效果。点击启动服务器。注意端口(默认:1234)并精确复制模型名称。
注意:请准确复制模型标识符。LM Studio 显示的是你需要传递给 ANTHROPIC_DEFAULT_SONNET_MODEL 的确切字符串。此处的不匹配是最常见的失败模式。
配置 Claude:
# 将基础 URL 设置为 LM Studio 的本地服务器
export ANTHROPIC_BASE_URL="http://localhost:1234"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_AUTH_TOKEN="lm-studio"
# 将模型名称替换为 LM Studio 显示的你加载模型的名称
# 请准确复制它,包括任何版本后缀或量化标签
export ANTHROPIC_DEFAULT_SONNET_MODEL="qwen2.5-coder-32b-instruct"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="qwen2.5-coder-32b-instruct"
export ANTHROPIC_DEFAULT_OPUS_MODEL="qwen2.5-coder-32b-instruct"或者持久化保存在 ~/.claude/settings.json 中:
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:1234",
"ANTHROPIC_API_KEY": "lm-studio",
"ANTHROPIC_AUTH_TOKEN": "lm-studio",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "qwen2.5-coder-32b-instruct",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "qwen2.5-coder-32b-instruct",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "qwen2.5-coder-32b-instruct"
}
}如何运行:
# 1. 从 GUI 启动 LM Studio 服务器(本地服务器标签 > 启动服务器)
# 2. 设置环境变量
export ANTHROPIC_BASE_URL="http://localhost:1234"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_AUTH_TOKEN="lm-studio"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-model-name-here"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-model-name-here"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-model-name-here"
# 3. 启动
claude# 后端 3: llama.cpp
当需要直接控制推理参数(如量化类型、KV缓存配置、批处理大小、线程数)时,或者在服务器上运行且希望获得最低开销时,llama.cpp 是最佳选择。它原生支持 Anthropic Messages API,因此不需要代理或翻译层。
- 一个 GGUF 格式的模型文件(从 Hugging Face 下载;搜索任何模型的 "GGUF" 版本)CUDA 能力 GPU 用于 GPU 推理,或仅 CPU 用于较慢的推理 CMake 和 C++ 编译器用于源代码构建(在 Linux/CUDA 上,建议使用源代码构建)
安装 llama.cpp:
# macOS -- Homebrew 是最简单的
brew install llama.cpp
# Linux with CUDA -- 从源代码构建以获得最佳 GPU 性能
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON # 启用 CUDA 加速
cmake --build build --config Release # 构建
# 二进制文件在 ./build/bin/
# Linux CPU-only 构建
cmake -B build
cmake --build build --config Release
# Windows -- 可在以下地址找到预构建的二进制文件:
# https://github.com/ggml-org/llama.cpp/releases
# 下载与你的硬件匹配的 CUDA 或 CPU 版本下载 GGUF 模型:
# 如果你还没有安装 Hugging Face CLI,请安装它
pip install huggingface-hub
# 下载 Q4_K_XL 量化版本的 GLM-4.7-Flash(约 4.5 GB)
# 这种量化方式在编码方面提供了良好的大小/质量平衡
huggingface-cli download unsloth/GLM-4.7-Flash-GGUF \
GLM-4.7-Flash-UD-Q4_K_XL.gguf \
--local-dir ./models/
# 或者下载 Q4 量化版本的 Qwen3-Coder(约 15 GB 用于 32B)
huggingface-cli download Qwen/Qwen3-Coder-32B-Instruct-GGUF \
qwen3-coder-32b-instruct-q4_k_m.gguf \
--local-dir ./models/启动 llama.cpp 服务器:
# 使用 Anthropic API 支持和 128K 上下文窗口启动 llama-server
llama-server \
--model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
--alias "glm-4.7-flash" \ # 这个名称会出现在 ANTHROPIC_DEFAULT_SONNET_MODEL 中
--port 8001 \
--ctx-size 131072 \ # 128K 上下文窗口 -- 对于大型代码库非常重要
--flash-attn \ # 内存高效的注意力机制,提高速度
--n-gpu-layers 99 # 将所有层卸载到 GPU;如果仅使用 CPU,请删除此参数
# 仅使用 CPU 进行推理(无 GPU):
llama-server \
--model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
--alias "glm-4.7-flash" \
--port 8001 \
--ctx-size 32768 \ # 在 CPU 上减少上下文大小以保持内存可控
--threads 8 # 与您的 CPU 核心数匹配关键参数说明:
- --alias : Claude Code 在请求中发送的模型名称字符串。将 ANTHROPIC_DEFAULT_SONNET_MODEL 设置为与此完全匹配。--ctx-size : 以 token 为单位的上下文窗口。131072 = 128K。更大的上下文窗口对代码库分析更好,但会使用更多 VRAM。如果遇到内存不足错误,请减少该值。--flash-attn : Flash Attention 通过以更小的块处理注意力来减少峰值 VRAM。只要您的构建支持,请启用此功能。--n-gpu-layers 99 : 将所有变压器层卸载到 GPU。如果 VRAM 紧张,服务器会自动使用更少的层。
export ANTHROPIC_BASE_URL="http://localhost:8001"
export ANTHROPIC_API_KEY="llama-cpp"
export ANTHROPIC_AUTH_TOKEN="llama-cpp"
# 必须与传递给 llama-server 的 --alias 完全匹配
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash"# 终端 1:启动 llama.cpp 服务器
llama-server \
--model ./models/GLM-4.7-Flash-UD-Q4_K_XL.gguf \
--alias "glm-4.7-flash" \
--port 8001 \
--ctx-size 131072 \
--flash-attn \
--n-gpu-layers 99
# 终端 2:配置并启动 Claude Code
export ANTHROPIC_BASE_URL="http://localhost:8001"
export ANTHROPIC_API_KEY="llama-cpp"
export ANTHROPIC_AUTH_TOKEN="llama-cpp"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash"
claude# 完整的 settings.json
环境变量导出仅在当前终端会话中有效。为了实现持久配置,请使用 ~/.claude/settings.json。Claude Code 在启动时会从该文件读取变量,因此无论从终端、VS Code 任务还是脚本启动 Claude,这些变量都会生效。
以下是包含所有变量解释的生产就绪 settings.json:
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_API_KEY": "ollama",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-4.7-flash:latest",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.7-flash:latest",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-4.7-flash:latest",
"CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1"
}
}为什么 CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS: "1" 重要:
在通过非Anthropic后端使用Claude Code时,Claude Code会在请求头中添加Anthropic特定的实验性Beta标志——这些标志是第三方和本地服务器无法识别的。这会导致大多数本地推理服务器出现错误:Unexpected value(s) for the anthropic-beta header。将此变量设置为"1"会在请求发出前移除这些头信息,从而消除错误,而不会影响Claude Code的核心功能。
在不同后端之间切换:
如果你使用多个后端——日常使用Ollama,复杂任务使用Anthropic API——最干净的方法是维护独立的shell脚本,而不是来回编辑settings.json:
# use-local.sh -- 切换到Ollama
export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="glm-4.7-flash:latest"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-4.7-flash:latest"
echo "Claude Code → local Ollama (glm-4.7-flash)"# use-anthropic.sh -- 切换回Anthropic API
unset ANTHROPIC_BASE_URL
unset ANTHROPIC_AUTH_TOKEN
unset ANTHROPIC_DEFAULT_SONNET_MODEL
unset ANTHROPIC_DEFAULT_HAIKU_MODEL
unset ANTHROPIC_DEFAULT_OPUS_MODEL
# ANTHROPIC_API_KEY 应该已经在你的rc文件中设置为真实的密钥
echo "Claude Code → Anthropic API"在当前会话中运行其中一个脚本:
source ./use-local.sh
claude
# 当你需要真实API处理复杂任务时:
source ./use-anthropic.sh
claude# 2026年Claude Code的最佳本地模型
硬件是主要的限制因素。对于Claude Code使用本地模型进行编码任务,而不是仅仅作为演示,应目标为32 GB的RAM——Apple Silicon统一内存或PC RAM。使用较小的量化模型和CPU卸载,16 GB也是可行的,但生成速度在多步骤代理任务上会明显变慢。
模型
所需VRAM
上下文
优势
许可证
拉取命令
glm-4.7-flash
8 GB
128K
工具调用,快速,低VRAM
Apache 2.0
ollama pull glm-4.7-flashdevstral-small-2:24b
16 GB
32K
代理编码工作流
ollama pull devstral-small-2:24bqwen3-coder
20 GB
代码生成,指令
ollama pull qwen3-coderqwen3.5:27b
256K
全能性强,大上下文
ollama pull qwen3.5:27bgemma4:26b
推理,77%编码基准
Gemma License
ollama pull gemma4:26b# 常见问题排查
- 启动Claude Code时连接被拒绝:推理服务器未运行。这是最常见的问题,也是最容易诊断的。 # 检查Ollama是否正在运行 curl http://localhost:11434 # 预期结果:"Ollama is running" # 检查LM Studio服务器是否正在运行 curl http://localhost:1234/v1/models # 应返回加载模型的JSON列表 # 检查llama-server是否正在运行 curl http://localhost:8001/health # 应返回 {"status":"ok"} # 如果未运行——先启动服务器,然后再启动Claude Code ollama serve # Ollama # LM Studio:使用GUI本地服务器标签 # llama.cpp:从后端3部分运行llama-server命令
- 模型未找到或未知模型错误:
ANTHROPIC_DEFAULT_SONNET_MODEL中的模型名称与服务器所知道的不匹配。 # 列出 Ollama 所有可用模型 ollama list #ANTHROPIC_DEFAULT_SONNET_MODEL中的模型名称必须完全匹配 # 包括标签 -- "glm-4.7-flash:latest" 而不是 "glm-4.7-flash" # 通过直接 API 调用确认服务器看到的内容 curl http://localhost:11434/v1/models
- 工具调用失败或返回错误:对于流式工具调用,Claude Code 在执行函数或脚本时会使用,需要 Ollama 0.14.3-rc1 或更高版本。0.14.x 系列的早期版本对流式工具调用的支持不完整。 # 检查你的 Ollama 版本 ollama version # 如果低于 0.14.3,更新 Ollama curl -fsSL https://ollama.com/install.sh | sh
anthropic-beta头错误:你会看到:错误:anthropic-beta头的值意外。这是因为 Claude Code 添加了本地服务器无法识别的 Anthropic 特定实验性 beta 标志。通过在settings.json的env块中添加以下内容来修复:"CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1"
- 恢复到 Anthropic API: # Shell 会话 -- 取消重定向变量 unset ANTHROPIC_BASE_URL unset ANTHROPIC_AUTH_TOKEN unset ANTHROPIC_DEFAULT_SONNET_MODEL unset ANTHROPIC_DEFAULT_HAIKU_MODEL unset ANTHROPIC_DEFAULT_OPUS_MODEL # 然后确保你的真实 API 密钥已设置 echo $ANTHROPIC_API_KEY # 应该显示你的 sk-ant-... 密钥,而不是占位符 # 如果你使用了
settings.json-- 删除或注释掉env块 # 并重新启动 Claude Code
- 生成速度慢:对于代理式 Claude Code 任务,生成速度很重要,因为每个工具调用都是一次往返。如果速度不够:切换到更小或更激进量化模型(Q4_K_M 而不是 Q8)。如果尚未设置,启用 llama.cpp 中的
--flash-attn。减少上下文大小(--ctx-size);更大的上下文预填充速度更慢。在 Ollama 上,将OLLAMA_NUM_GPU_LAYERS=99添加到你的环境变量中,以强制最大 GPU 卸载。
# 结论
过去需要脆弱的适配器和技巧才能完成的事情,现在只需五步即可完成。安装推理后端,拉取一个模型,设置三个环境变量,Claude Code 就会路由到你的本地机器,而不是 Anthropic 的 API。一旦你下载了模型,配置过程不到五分钟。
实际的结果是一个在设置后运行成本为零的编码助手,没有速率限制,完全在你的机器上保存代码,并且在质量水平上覆盖了绝大多数实际编码使用案例,这些质量水平在一年前的本地模型中是无法实现的。从 Ollama 和 glm-4.7-flash 开始,它对硬件的要求最低,工具调用支持最一致,并且是通往工作设置最快的路径。一旦它运行起来,根据你的硬件和实际需要的质量级别,再扩展模型。
Shittu Olumide 是一位软件工程师和技术作家,热衷于利用前沿技术创作引人入胜的故事,对细节有敏锐的眼光,擅长简化复杂概念。你也可以在 Twitter 上找到 Shittu。
更多关于此主题的内容
- 节俭的本地代理编程:Claude Code + Ollama + Gemma4
- Claude Code 高效技巧
- 10 个 GitHub 仓库掌握 Claude Code
- 7 种实用方法减少 Claude Code 的 Token 使用量
- 使用 Claude Code 的 5 个有趣项目
- 如何本地设置 Claude Code 通道
<hr class="grey-line"><br> <div><h3>我们推荐的前5门免费课程</h3><br> </div>
Mailchimp for WordPress v4.13.0 - https://wordpress.org/plugins/mailchimp-for-wp/
/ Mailchimp for WordPress 插件
你可以从此处开始编辑。
如果评论已关闭。
<= 上一篇
#content end
<script type="text/javascript">kda_sid_write(kda_sid_n);</script>
最新文章
- 将 Claude Code 与本地模型结合使用 3 个 NumPy 技巧提升数值性能 从零开始构建特征存储:一个最小可行实现 为你的创业点子获取资金的 7 种最佳方式 低成本实现本地代理编程:Claude Code + Ollama + Gemma4 自动化无聊 PDF 任务的 5 个有用 Python 脚本
热门文章
- Anthropic 完整指南:Claude 技能构建
- 自动化无聊 PDF 任务的 5 个有用 Python 脚本
- 将 Claude Code 与本地模型结合使用
- AI 工程师必须掌握的 5 个 Python 概念
- 为你的创业点子获取资金的 7 种最佳方式
- 用于 Python Web 开发的 10 个 GitHub 仓库
- 5 篇有趣论文清晰解释了大型语言模型
- 代理时代对数据科学的意义
- 用于现代数据库系统和工具的 10 个 GitHub 仓库
#content_wrapper end
© 2026
Guiding Tech Media
|
关于
联系我们
广告合作
隐私政策
服务条款
发布于 2026 年 6 月 12 日,作者是 Olumide Shittu
blank
不,谢谢!
/.main_wrapper
<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>
noptimize
/noptimize