Qwen 3.6 27B is the sweet spot for local development
TL;DR · AI 摘要
Qwen 3.6 27B is the sweet spot for local development - Quesma Blog Hero Section @license lucide-static v1.16.0 - ISC Bac...
核心要点
- 主题聚焦:Qwen 3.6 27B is the sweet spot for local develop
- 来源:Hacker News Best,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
Qwen 3.6 27B 是本地开发的理想选择 - Quesma 博客
Hero Section
@license lucide-static v1.16.0 - ISC
返回博客
Qwen 3.6 27B 是本地开发的理想选择
Piotr Migdał
2026 年 6 月 29 日
下载 PNG
在
Hacker News 首页
2026 年 6 月 29 日
内容
我过去对本地模型感到失望。但当我测试了 Qwen 3.6 后,我感到惊叹。对我而言,这是首个真正具备通用智能潜力的本地模型。
该模型有两种变体:专家混合模型 Qwen 3.6 35B A3B,以及更强大的密集模型 Qwen 3.6 27B(速度稍慢)。我推荐后者!
让我分享我的使用体验,并展示你也可以运行它。
它真的会发热。当我的膝盖开始融化时,我用连接手机的热成像仪拍了张照片。
Qwen 3.6 在 Hacker News 上获得了大量关注。关于 Qwen 3.6 27B 最常见的评价是它"实力超出了其规模"(见 Will it Mythos?)。我认为这种评价是实至名归的。它会让电脑变热,但绝对值得!
初步测试
Simon Willison 使用"骑自行车的企鹅"作为烟雾测试(见 Qwen 3.6 35B A3B 和 Qwen 3.6 27B)。我通常使用受限写作进行测试。
一年前这类任务需要独特的、价格惊人的 GPT-4.5(见 vibe 翻译 Quantum Flytrap)。
我还让它创作了一首关于 Zouk 舞蹈和量子物理的 8 行诗(见记录)。它的思考过程在量子术语的使用和押韵方面都合情合理。
然后我在 OpenCode 中要求它使用 pnpm 创建一个六边形扫雷游戏。它成功了:
第一次尝试就成功了,通过单一提示生成了完整的 Node 包。专家混合模型 Qwen 3.6 35B A3B 更快...但忽略了创建包的指令,直接生成了单个 index.html 文件。
实际应用
当然,关于量子力学的创意写作,或者又一个扫雷游戏克隆,很少能成为日常工作。但 Qwen 3.6 27B 在常规任务中也同样表现出色。
朋友 Maciej Cielecki(AI Tinkerers Warsaw)提供的提示:
它运行了几分钟,生成了以下内容:
按照当前前沿模型的标准,这并不特别。但它已经是一个实用的工具了。它运行正常、响应及时、默认设置友好——所有这些都来自一个简短的提示。
使用 llama.cpp 本地运行 Qwen 3.6
本地运行模型比以往任何时候都更容易。只需几条 CLI 命令即可开始。
我推荐使用 llama.cpp - 一个直接的开源工具,允许在各种设备上运行模型。你不需要 Ollama,坦白说 - 从伦理角度我建议不要使用它。
首先,我们前往 Hugging Face 获取合适的量化版本,即经过压缩的模型 - 流行的版本由 unsloth 或 bartowski 提供。默认模型通常使用 BF16 精度。常见的 8 位量化可以几乎不损失质量的情况下节省一半空间。继续深入,模型会更小(可能更快),但会牺牲质量,见 27B 和 35B A3B 的对比。
我们获取 unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0,这是一个支持多令牌预测(MTP)的 8 位量化版本。
llama-server
-hf
unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0
\
--spec-type
draft-mtp
-ngl
999
-fa
on
-c
65536
--port
8080它的作用:
- -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 从 Hugging Face 获取模型,后续运行将复用该模型
- 如果已经拥有该模型,可使用 -m ~/models/Qwen3.6-27B-Q8_0.gguf 代替
- draft-mtp 我们使用快速模型预测后续标记,加快处理速度
- -ngl 999 将所有层加载到 GPU
- -fa 启用闪存注意力
- -c 65536 将上下文大小设置为 64k 标记(我们可以调整此参数,因为 Qwen 3.6 27B 原生上下文为 256k)
- --port 8080 建议固定端口,因为它会被其他配置使用
如果打开 http://127.0.0.1:8080,你可以直接与它聊天。
这个服务器同样可以用于 vibe 编码。代理选择取决于目标和主观偏好 - 对于全能型 OpenCode、极简主义 Pi 和自我改进型 Hermes 都适用。
对于 OpenCode,只需在 ~/.config/opencode/opencode.jsonc 中添加:
{
"$schema"
:
"https://opencode.ai/config.json"
,
"provider"
: {
"llama"
: {
"name"
:
"llama.cpp (local)"
,
"npm"
:
"@ai-sdk/openai-compatible"
,
"options"
: {
"baseURL"
:
"http://127.0.0.1:8080/v1"
,
"apiKey"
:
"local"
},
"models"
: {
"qwen3.6-27b"
: {
"name"
:
"Qwen3.6-27B Q8 +MTP"
}
}
}
},
"model"
:
"llama/qwen3.6-27b"
}如果你只想聊天并且是终端的忠实粉丝,可以使用 llama-cli 代替 llama-server:
llama-cli
-hf
unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0
\
-ngl
999
-fa
on
-c
65536性能评估
速度足够快吗?
我在 Macbook Max M5 128 GB 上运行了一些测试(源代码在这里),分别测试了启用和禁用多标记预测的情况,并与 35B A3B 模型以及量化版 DeepSeek V4 Flash 版本 DwarfStar4 进行了比较。
标记/秒
RAM
Qwen3.6-35B-A3B
· 8-bit
MLX
85 tok/s
85
37 GB RAM
37 GB
llama.cpp
93 tok/s
93
44 GB RAM
44 GB
llama.cpp + MTP
105 tok/s
105
45 GB RAM
45 GB
Qwen3.6-27B
17 tok/s
17
28 GB RAM
28 GB
18 tok/s
18
41 GB RAM
41 GB
32 tok/s
32
42 GB RAM
42 GB
DeepSeek-V4-Flash
· Q2–Q4
33 tok/s
33
103 GB RAM
103 GB
每秒生成30个标记并不算差,完全在典型前沿模型API速度范围内。虽然mlx-lm专门针对苹果硅芯片设备,AI代理强烈推荐它,但llama.cpp证明了更快的速度。它使用了95%的GPU,这意味着它能有效利用可用资源。
Macbook Max M5 是一款强大的设备(至少对于笔记本电脑而言),但在其他设备上也能良好运行。如你所见,Qwen 3.6 的两个版本都在苹果硅共享RAM的48GB范围内运行。在消费级Nvidia RTX显卡上,你需要更激进地量化——但推理速度甚至更快。
我今天在5090上使用Q6_K量化和Q4_0 KV设置,通过LM Studio稳定获得50个标记/秒,123k上下文使用约28/32gb显存。- gfosco 在 Hacker News 上
虽然35B A3B快3倍,但我更喜欢27B。我宁愿生成三分之一的代码,但质量更高。
它们与之前最先进的模型有何关联?
人工检查很棒,但基准测试有助于验证直觉。这是来自 Artificial Analysis 的评分,与前沿模型进行比较:
Gemma 4 31B
29
≈ 2024年末
o1 / Claude 3.5 Sonnet
≈ 2025年初
o3 / Claude 4 Sonnet
37
≈ 2025年中
GPT-5 / Claude Sonnet 4.5
40
≈ 2025年末
GPT-5.2 / Claude Opus 4.5
这些笔记中还有其他几个基准测试,但精神是相似的。这里添加了 Gemma 4 31B,因为很多人将其作为本地编码的默认选择。但无论是基准测试还是网络上的普遍观点,都强烈倾向于 Qwen 3.6 27B。
需要注意的是——8位量化对结果影响可能不大,但DwarfStar4对DeepSeek V4 Flash采用了更激进的2-4位量化方案。可以肯定的是,这种量化方式的表现会弱于完整模型。我个人的感觉是,在这些量化版本中,Qwen 3.6 27B的表现与DwarfStar4相当(甚至可能略胜一筹)。不过,如果在长上下文任务中DS4有优势,我也不会感到意外。
接下来会发生什么
我认为我们正在进入一个令人着迷的时代,个人运行自己的模型将成为现实。
这一趋势将随着专有前沿模型的商业化进程进一步加速。Claude Fable 5已经下线,其他前沿模型则以巨额补贴运行——每月支付100美元即可获得价值数千美元的token。让我们在优惠持续期间充分利用这个机会!
本地部署的模型可以按需进行微调,且不会被他人拿走。企业可以将其用于处理专有和敏感数据。我们个人也可以将其用于离线项目,或在不愿向美国或中国分享最深层秘密或医疗数据时使用。
随着前沿级开源模型GLM 5.2的发布,一个新时代已经开启。虽然Qwen 3.6是重要的过渡模型,但即使是前沿级的GLM 5.2也能够在本地运行。它无法在MacBook或单块RTX 5090上运行,但通过企业预算仍然可以实现部署。
此外,我坚信我们将拥有比当前最先进模型更智能的模型,且这些模型可以运行在本地设备上,甚至可能运行在智能手机上。当前模型将原始智能与事实知识整合在统一的权重中,而未来模型很可能会将这两者分离,将大量知识转移到工具调用中。
在Hacker News、LinkedIn或X上讨论
订阅通讯与RSS
敬请关注后续文章和发布
或
通过RSS订阅
博客文章的 JSON-LD