Towards Data Science

How to Choose Between Small and Frontier Models

7.1内容质量

TL;DR · AI 摘要

How to Choose Between Small and Frontier Models Towards Data Science Artificial Intelligence How to Choose Between Small...

核心要点

  • 主题聚焦:How to Choose Between Small and Frontier Models
  • 来源:Towards Data Science,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#后端#云计算#安全
打开原文

如何在小型模型与前沿模型之间做出选择 | Towards Data Science

人工智能

如何在小型模型与前沿模型之间做出选择

小型语言模型的崛起

Sara Nobrega

2026年6月29日

12分钟阅读

分享

由DALL-E生成的图片。

小型模型,大有可为

在过去的三年中,AI领域大多数时候的反应都很简单。

你有一个AI任务,就会调用GPT或Claude或Gemini。但到了2026年,这种反应方式变得昂贵且很多时候并不必要。

如今,你可以在自己的笔记本电脑上运行的模型,已经能够处理大量实际工作:分类、提取、摘要、代码补全、文档问答。

这些是这些任务的生产版本,是团队和开发者实际部署的版本。

从2025年底到2026年中,有五个因素几乎同时发生了变化:

  • 硬件
  • 开源工具
  • 令牌成本
  • 监管
  • 以及文化上对拥有自主工具的倾向。

其中任何一个因素都值得单独用一段来讨论。但综合来看,它们将小型语言模型(SLMs)从一种业余爱好者的探索,变成了启动项目的合理选择。

我将向你展示发生了哪些变化,选择小型模型时需要放弃什么,何时应该选择SLM,以及如何今晚就运行一个SLM。此外,还有一些你可以直接复制的代码。

你好,我是Sara Nóbrega,专注于将机器学习系统部署到生产环境的AI工程师。我在这里更多地撰写关于AI工程的内容。

本文内容

  1. 为何现在选择小型模型
  2. 选择SLM时需要放弃什么
  3. 何时选择SLM(以及何时不选择)
  4. 今晚运行一个SLM
  5. 对于机器学习工程师:微调还是提示?
  6. 更宏观的视角

首先定义一个概念,因为“小型”可能会被误解。

我将用SLM来指代参数量约为10亿到140亿的模型。

对于专家混合模型,我计算的是活跃参数,因此Qwen3-30B-A3B(30亿活跃参数)会被计入。而“前沿模型”我指的是GPT-5.x、Claude Opus 4.x、Gemini 3.x、Grok 4。请将边界视为模糊的。

1. 为何选择小型模型,以及为何现在

关于小型语言模型的讨论在NVIDIA Research发布报告时迎来了热潮。

他们2025年6月的论文《Small Language Models are the Future of Agentic AI》(Belcak等)提出,大多数智能体流水线中狭窄且重复的子任务不需要前沿模型,并估计40%到70%的企业AI任务可以在低于100亿参数的模型上运行。

该领域本身已经朝着这个方向发展,而这篇论文为其命名。让我们探讨是什么使这种变化成为可能。

2026年的人工智能:强大的能力,众多工具,不断增长的成本,可见的硬件限制,以及试图将整个领域控制在虚线内的监管。图片由Dall-E生成。

五个原因

能力(肌肉)

这是人们容易低估的部分:如今30亿到140亿参数的模型在特定任务上的表现,已经可以达到12到18个月前700亿参数模型的水平。

一些例子:

  • 微软的Phi-4(140亿参数)在MMLU测试中得分为84.8,在HumanEval测试中得分为82.6,超过了Llama-3.3-70B的78.9分。
  • Phi-4-reasoning-plus(140亿参数)在AIME 2025测试中达到77.7%,与6710亿参数的DeepSeek-R1在该基准测试中的表现相当。

这些模型与大型模型的设计方式不同:它们是在精心策划的合成数据上训练的,从更大的教师模型中蒸馏而来,并且从一开始就进行了量化,而不是事后压缩。

Apple 的 M5(2025 年 10 月)内存带宽达到 153 GB/s,搭载 M3 Ultra 的 Mac Studio(800+ GB/s,最高 512 GB 统一内存)可本地运行量化后的 DeepSeek 671B 模型。

NVIDIA 的 DGX Spark 于 2025 年 10 月以 3999 美元的价格发布,配备 128 GB 统一内存,单机可运行最高 200B 参数的模型。AMD 的 Framework Desktop 以 1999 美元的价格实现类似功能。即使是 2026 年旗舰手机搭载骁龙 8 Elite Gen 5 也能实现每秒 100+ token 的解码速度。

工具(双手)

围绕这一领域,开源工具生态逐渐成熟。Hugging Face 的公开模型数量已突破 200 万。Ollama 成为默认的本地后端,LM Studio 于 2025 年 7 月起开放商业用途免费使用。

Hugging Face 在《2026 年开源软件报告》中披露的关键数据是:92.5% 的模型下载量集中在参数量低于 1B 的模型。全权重模型的使用规模依然非常有限。

成本(胃口)

成本问题变得更为复杂,而非更简单。

2025 年初至 2026 年初,主流 API 价格下降了约 80%。

但推理 token 按输出计费,长度是可见响应的 3-5 倍,代理对话的每次交互成本呈平方级增长。

IntuitionLabs 记录的一次 Claude 对话显示:14 token 的问题在第 1 轮仅花费 0.0018 美元,到第 260 轮时已累积至 2.41 美元,仅凭历史记录就增长了 1339 倍。

在这种情况下,企业最终采取了分层路由策略:

  • 约 70% 本地 SLM
  • 20% 中端 API
  • 10% 前沿 API

监管(缰绳)

监管方向与上述趋势一致。

欧盟 AI 法案的高风险义务将于 2026 年 8 月 2 日全面实施,距离本文撰写不足两个月。

HIPAA 从未适应过大语言模型,医疗数据泄露的平均成本高达 444 万美元,是各行业中最高的。

2025 年 5 月《纽约时报诉 OpenAI》法院命令要求无限期保留甚至已删除的 ChatGPT 对话,这让许多企业对向 API 传输数据产生了强烈担忧。

2. 选择 SLM 时你将失去什么

SLM 与前沿模型并非替代关系,而是取舍关系。本地模型在速度、隐私、成本和控制力上占优,而前沿模型在深度、规模、上下文处理和开放推理能力上占优。图片由 DALL-E 生成。

选择小型化模型意味着取舍,先明确说明劣势所在。

前沿模型仍在解决硬问题上占优。截至 2026 年中:

  • GPT-5.4 在无需工具的情况下 AIME 2025 考试得分为 100%
  • Claude Opus 4.6 在 SWE-bench Verified 测试中达到 80.8%
  • Gemini 3.1 Pro 在 GPQA Diamond 测试中达到 94.3%

最佳的 30B 参数代码 SLM 在 SWE-bench Verified 测试中最高仅达 50%。这一差距显著且具有针对性。

SLM 的劣势领域(盲区)

在以下五个方面始终存在差距:

  • 复杂多步骤抽象推理
  • 超过 128K token 的连贯上下文处理
  • 跨大型代码库的前沿级编程能力
  • 英语和中文以外语言的深度理解

如果任务涉及上述领域,小型模型将令你感到挫败。

关于数据的说明

MMLU、HumanEval 和 GSM8K 在 85% 以上已趋于饱和,且越来越多受到训练数据污染。

2026 年比较模型时,建议使用以下更具区分度的指标:

  • GPQA Diamond
  • SWE-bench Verified
  • ARC-AGI-2
  • HLE
  • LiveCodeBench

你将获得的优势

这些优势在基准测试中难以体现,但在实际应用中至关重要:

  • 延迟:首 token 生成时间 50-200 ms,对比云端调用的 200-800 ms
  • 受监管工作负载的数据主权
  • 版本锁定功能,防止供应商在未通知情况下更换模型
  • 离线操作
  • 可复现性

一个警告:本地 ≠ 安全

在本地运行模型并不一定意味着更安全。

2025 年 2 月,ReversingLabs 发现 Hugging Face 上存在恶意模型,攻击者利用损坏的 pickle 文件绕过扫描器,植入反向 shell,这些模型在未被发现的情况下持续存在了约八个月。

当年春天的一次扫描发现了 51,700 个模型中共有 352,000 个不安全或可疑问题。

提示注入对本地模型同样有效,RAG 内容可以携带指令,Ollama 和 LM Studio 等工具默认不包含安全分类器。

在本地运行模型会将风险转移到你的环境中。

3. 何时选择小型模型(以及何时不选择)

选择小型模型的场景

  • 任务是高吞吐量且狭窄的:分类、提取、路由、摘要。
  • 延迟至关重要:自动补全或语音交互,需要首字生成时间低于 100 毫秒。
  • 你处于隐私监管领域:医疗、法律、金融或政府,数据不能离开本地。
  • 是代理子任务、边缘或离线部署,或任何每日处理超过数百万 token 的工作负载,此时 API 计费将成为主要成本。

选择前沿模型的场景

  • 工作是开放式的或一次性任务:创意写作、研究协助,或跨大型代码库的调试。
  • 需要广泛的世界知识:复杂多工具代理,或跨长尾语言的客户服务。
  • 任务量低:每天可能只有不到 1,000 次请求,跨多种任务。此时 API 更便宜且性能更好。

不要为了每月节省 20 美元而微调小型模型。

2026 年的有用问题是明确的:你还需要前沿模型的场景在哪里?对许多团队来说,诚实的答案可能比他们预期的要少得多。

4. 今晚就运行一次

你可以在大约十分钟内测试所有内容。

安装并拉取模型

安装 Ollama 或 LM Studio。从模型浏览器中选择一个合理的默认模型:Llama 3.2 3B、Gemma 3 4B 或 Qwen3-4B-Instruct-2507(Q4_K_M 量化)。然后拉取并聊天:

code
# 安装 Ollama 后
ollama pull qwen3:4b
ollama run qwen3:4b

Ollama 在端口 11434 上提供 OpenAI 兼容的 API,默认绑定到 127.0.0.1,因此不会有任何数据离开你的机器。

将现有代码指向它

code
from openai import OpenAI
# 使用与云相同的 SDK,但指向本地模型
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
    model="qwen3:4b",
    messages=[
        {"role": "user", "content": "用三个要点总结这个支持工单:..."}
    ],
)
print(resp.choices[0].message.content)

需要多少内存

在 4 位精度下,模型内存占用的粗略规则是:每十亿参数预算约 0.6 到 0.8 GB,加上 1 到 4 GB 的上下文和开销。

  • 8 GB 内存可运行 1 到 3B 模型
  • 16 GB 内存可舒适运行 7 到 8B 模型
  • 32 GB 内存可运行 13 到 14B 模型,或 27 到 30B 模型(如果耐心等待)
  • 24 GB 显卡(如 RTX 4090)可良好运行 Gemma 3 27B(QAT)或 Qwen3-30B-A3B

如实设定预期

3 到 8B 的本地模型大致相当于 2023 年的 GPT-3.5:实用但不神奇。

它擅长摘要、重写、基础问答、代码补全和基于你自己的文档的 RAG。但在深度推理、多步骤复杂问题和冷门事实回忆方面表现较弱。

现代笔记本电脑预计每秒生成 10 到 40 个 token,RTX 4090 可达到 80 到 150 个 token。

路由模式,简要说明

如果你想实现第1节中提到的分层路由,逻辑在使用框架之前很容易进行原型设计:

code
# 玩具路由器:在本地处理狭窄任务,仅在任务真正需要广泛推理或长上下文时升级到前沿模型
def answer(task):
    if task.kind in {"classify", "extract", "summarize", "route"}:
        return local_slm(task.text)     # 在你的机器上运行,成本接近免费
    if task.tokens > 128_000 or task.kind == "open_ended":
        return frontier_api(task.text)  # 广泛推理,长上下文
    return local_slm(task.text)         # 默认使用本地模型,低置信度时回退

在生产环境中,你会添加对本地答案的置信度检查并在失败时升级,但这就是其大致形态:大多数调用都保持在本地,昂贵的调用只是例外。

5. 对于机器学习工程师:微调还是提示?

如果你已经过了演示阶段,关键决定是是否微调一个小模型或继续提示一个大模型。

何时微调小模型

  • 任务狭窄且在规模上重复。NVIDIA的经验法则:稳定的模式加上每天超过10,000次请求。
  • 延迟或成本上限限制,隐私要求本地部署,或需要行为可靠性。

带有约束解码的小模型(如Outlines、XGrammar)可实现99%以上的模式有效性,而大模型会偏离。

何时继续提示前沿模型

  • 任务开放、演进或低频,或需要广泛的世界知识。
  • 知识变化:RAG无论如何都优于微调。

如果你进行微调:2026年的默认设置

QLoRA是默认选择:4位NF4基模型加BF16 LoRA适配器。

  • 秩:从16开始,对于更难的任务提高到32-64。
  • Alpha:32
  • 学习率:监督微调使用~2e-4,DPO使用5e-6
  • 轮数:1到3轮(通常更多会导致过拟合)
  • 在你提供的精度下进行训练。

Unsloth可以在单个16GB GPU上运行Llama 3.1 8B QLoRA:

code
from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="unsloth/Qwen3-4B-Instruct",
    max_seq_length=4096,
    load_in_4bit=True,                # NF4 4位基模型
)

model = FastLanguageModel.get_peft_model(
    model,
    r=16, lora_alpha=32,              # 更难的任务提高到32-64
    target_modules=["q_proj", "k_proj", "v_proj", "o_proj",
                    "gate_proj", "up_proj", "down_proj"],
)

# 然后使用TRL的SFTTrainer以lr=2e-4进行1-3轮训练。

需要多少数据?

  • 风格和格式适配:100到1,000个优质样本对
  • 分类或提取:1,000到10,000个示例
  • 注入领域知识:10,000到100,000个(达到此数量级时,考虑使用RAG)
  • 推理蒸馏:100,000到1,000,000个追踪:这就是为什么Phi-4-reasoning使用了140万个精选提示。

团队通常会跳过并后悔的是评估。

在训练前,构建一个包含100到500个人工评分示例的任务特定评估集。

跟踪模式有效性、精确匹配、可执行调用率、p95延迟和每个成功任务的成本。

lm-eval-harness、promptfoo和Arize Phoenix等工具可以处理这些机制。

仅在你已通过人工评分验证其合理性后,才使用LLM作为裁判。

简明扼要的决策总结

如果你在单一狭窄任务上每秒处理超过10个请求,应微调一个3到8B的模型并自行托管,因为体积足以证明前期投入的努力,节省的成本会累积。

如果你每天的请求量在100次以下且涉及多种任务,不必费心:直接调用API即可,因为你永远无法收回训练和维护自有模型所花费的时间。

如果你处于中间状态,建议从提示加RAG开始,只有在评估集停止提升时才考虑微调。

6. 更宏观的视角

这一切背后都伴随着文化层面的转变。

2025年,美国黑胶唱片收入自1983年以来首次突破10亿美元大关:连续第19年增长,Z世代购买了约30%的新唱片。人们正在选择自己拥有并持有的事物,而非来自他人服务器的流媒体内容。

Cal Newport将对云服务的依赖视为继社交媒体之后的下一个主权问题。Ted Gioia则将拥有自己的分发渠道和工具与拒绝参与未主动要求的AI建设部分联系起来。

你机器上运行的小型模型正契合这种思维模式。

2025年购买黑胶唱片《Rumours》的同一批人,将在2026年下载Qwen3-4B模型,且出于相似原因:它属于你、数量有限、可离线使用,且未经你同意不会被修改。

趋势汇聚成趋势

2026年成为小型模型之年并非单一因素驱动。在九个月内,硬件、开源工具、成本压力、监管和文化因素共同推动了这一趋势。

正是这种合力改变了默认选择。

所以在你下一个项目中考虑使用前沿模型之前,请先问自己是否真的需要它。然后今晚就运行小型模型,看看它能带你走多远。对很多工作来说,其效果可能超出你的预期。

感谢阅读!

我的名字是Sara Nóbrega,我是一名专注于MLOps和机器学习系统生产部署的AI工程师。

有用链接:

  • 成为AI高级用户
  • LinkedIn
  • 支持我的工作

参考文献

  • [1] P. Belcak等,小型语言模型是代理AI的未来(2025),arXiv:2506.02153
  • [2] 微软研究院,Phi-4技术报告(2024),arXiv:2412.08905
  • [3] Hugging Face,开源AI现状(2026)
  • [4] ReversingLabs,在Hugging Face发现恶意ML模型("nullifAI")(2025),ReversingLabs博客
  • [5] OWASP,2025年LLM应用十大风险(2024),OWASP基金会
  • [6] 欧盟委员会,欧盟AI法案实施时间表(2026),欧盟官方期刊

撰写者

查看Sara Nobrega的全部文章

前沿模型

,

LLM

小型语言模型

分享本文

  • 在Facebook上分享
  • 在LinkedIn上分享
  • 在X上分享

Towards Data Science是一个社区出版物。提交你的见解以触达全球读者,并通过TDS作者支付计划获得报酬。

更新为你的实际投稿链接

为TDS撰写文章

✦ 结束CTA ✦