Building an AI Text Detector From Scratch

TL;DR · AI 摘要
从零构建AI文本检测器的完整教程,涵盖数据集构建、模型训练和本地部署,揭示检测器与生成模型的对抗性本质。
核心要点
- 使用Pangram模型方法构建AI文本检测器,可识别AI生成文本特征
- 本地部署的API能返回全文AI检测评分及文本片段分析结果
- 检测器与生成模型存在持续对抗,需定期更新模型以应对新生成模式
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI文本检测器构建
- 技术实现
- Pangram模型方法
- 本地API部署
- 应用场景
- 内容过滤
- 写作辅助
- 对抗挑战
- 生成模型规避检测
- 误判风险控制
金句 / Highlights
值得收藏与分享的关键句。
Substack的AI检测功能通过分析文本特征识别AI生成内容,但存在误判风险。
构建的检测器API可返回全文AI评分,并支持文本片段的细粒度分析。
AI检测器与生成模型形成持续对抗,需通过迭代更新模型来保持检测有效性。
从零开始构建AI文本检测器
一个包含数据集构建、模型训练、本地部署和RLVR的端到端项目
Sebastian Raschka,博士
2026年8月15日
Substack最近在用户界面中推出了AI检测功能,这非常有趣。
另外,很多人问我关于有趣的本地DIY大型语言模型(LLM)项目,作为演示小型语言模型(SLM)能力的案例。
将两者结合起来,我认为展示如何实现AI检测器会很有趣。我还将用它作为验证器,训练一个小语言模型生成能规避检测的文本。这是一个小型教育项目,用于研究AI检测器的局限性,并探索基于验证器的LLM应用,超越常规的数学和代码训练推理模型。
图1:Substack现在内置了AI检测器功能。
如上所述,本教程的目标是通过构建(一个简单的)AI检测器来解释其工作原理。
实际上,这种检测器可以用来过滤垃圾内容,同时也能帮助改进个人写作,而无需将其转化为AI生成的文本。例如,如果你写了一篇长文并想提高拼写和语法,使用语法检查工具进行润色和提升可读性是诱人的(而且确实有用)。有多种服务可以实现这一点,包括ChatGPT等通用LLM。然而,这也存在风险,这些工具可能会将你的写作(即使仍然是你自己的写作)过度润色,使其听起来像AI生成内容并被标记为垃圾内容。
例如,使用AI检测器时,可以这样要求:"在保持文本AI生成检测评分为0%的同时修复我的语法。"
无论如何,虽然我们将在这里构建一个功能齐全的检测器,但目标是解释1)AI检测器(如何)工作,以及2)将其作为案例研究,探讨如何构建可用于LLM的评分器或验证器的一般方法。
免责声明:AI检测器本质上是一场猫鼠游戏。AI检测器可能会学习到某种能指示AI生成内容的模式。随后,下一个LLM可能会偶然或故意避免这种模式以规避检测。AI检测器随后需要更新以检测该LLM,以此类推。此外,它也很可能会遇到误报(将人类撰写的文本标记为AI生成内容),但稍后会详细讨论这一点。
项目目标
本项目有几个目标。总体目标是说明AI检测器的工作原理,并展示一个包含评估、训练和本地部署的端到端LLM项目,用于实际应用。
该项目的成果是一个可供人类和代理使用的AI检测器API,以及一个用户友好的用户界面。
图2:本项目后期开发的本地浏览器界面预览。它会返回整篇文本的AI评分,并可以突出显示各个文本片段的评分。
方法概述
在这里,我们将开发一种类似于Pangram模型的方法,据我所知,这种模型是Substack AI检测功能背后的技术。
我在2023年写过一篇关于AI文本检测的短文:《检测ChatGPT等LLM生成内容的不同方法有哪些?它们是如何工作和相互区别的?》
本质上,检测AI生成文本的方法有多种,包括监督分类器、基于扰动的概率测试、困惑度衡量以及水印技术。
在本教程中,我们将构建一个返回0-100分的模型。本质上这是一个带有概率评分的分类器。该概率评分将表示文本被判定为AI生成的可能性(更准确地说,该评分是分类器根据训练分布对AI生成类别估计的概率。但需要注意的是,这并不应被解释为文本由AI撰写的普遍概率)。
为此,我们将对DistilBERT分类器进行微调(类似于我早期在Substack文章《微调大型语言模型》中描述的方法),但关于该部分的更多细节将在后续阶段再详细说明。
本文仅供付费订阅者阅读
已是付费订阅者?