Towards Data Science

How to Build a Powerful LLM Knowledge Base

7.1内容质量

TL;DR · AI 摘要

How to Build a Powerful LLM Knowledge Base Towards Data Science Large Language Models How to Build a Powerful LLM Knowle...

核心要点

  • 主题聚焦:How to Build a Powerful LLM Knowledge Base
  • 来源:Towards Data Science,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#安全
打开原文

如何构建强大的LLM知识库 | Towards Data Science

大型语言模型

如何构建强大的LLM知识库

使用编码代理增强你的知识库

Eivind Kjosbakken

2026年6月27日

9分钟阅读

分享

在本文中,我将讨论如何构建由LLM驱动的知识库。图片由ChatGPT生成。

知识库是一种存储大量信息并使其未来可访问的概念。这对以下方面具有巨大价值:

  • 更好的决策制定
  • 快速获取过往上下文
  • 统一团队认知

最近,我开始大量投入知识库的建设,并尽可能将更多上下文纳入其中,以提升上述所有方面。即使在LLM出现之前,知识库就已具备价值,因为获取过往知识始终是有用的。但随着LLM的出现,知识库的能力呈指数级增长。

这主要归因于两个原因:

  • 你可以在知识库中捕获更多信息
  • 你可以更轻松地查询知识库(无需手动查找)

在本文中,我将涵盖为什么你应该建立自己的LLM驱动知识库、如何尽可能多地捕获信息,以及如何积极使用知识库。

这幅信息图突出了本文的主要内容。我将讨论如何通过编码代理构建知识库、为什么要这样做、如何将信息路由到其中,以及如何在推理过程中使用这些信息。图片由ChatGPT生成。

我之前曾讨论过这个话题,但随着知识库概念的流行,我对其重要性的认识越来越深刻。例如,你可能注意到Y Combinator的总裁正在构建GBrain,或者Andrej Karpathy正在构建LLM维基,这些都是知识库的典型案例。

当然,构建知识库的最佳方式并没有绝对标准。我认为最重要的是开始将所有上下文存储到知识库中,并持续探索如何有效查询知识库,例如在编写代码、参加会议等场景中。

为什么你需要知识库

首先,我想说明为什么你需要知识库。你可以拥有不同类型的知识库。例如,你可以拥有包含个人所有上下文的个人知识库,或者拥有包含公司全部知识和上下文的企业级知识库。

你需要知识库的原因在于信息具有极高的价值。你能存储并随时访问的信息越多,表现就会越好。例如,你可以:

  • 因为拥有更多上下文而做出更优决策
  • 快速回顾过往主题,无需在各种来源中搜索相关信息
  • 通过统一的事实来源实现团队成员的认知对齐

这些概念无论你拥有个人知识库还是企业级知识库都基本适用。我也认为这些知识库因为可以使用大语言模型(LLMs)进行查询而变得强大得多。过去,你必须手动浏览知识库才能找到相关信息,需要依靠自己的记忆判断某些信息是否存储在知识库中,然后决定是否花时间查找这些信息。

现在情况完全发生了转变。大语言模型可以直接通过RAG类型方法查询知识库,立即自动找到相关信息。大语言模型可以自行决定何时需要使用知识库。

也就是说,你完全去除了访问知识库信息所需的人工干预环节,这让知识库变得前所未有的强大。

将信息捕获到知识库中

知识库的第一步当然是将信息捕获到知识库中。具体如何实现取决于你的知识库构建方式,这可能有多种不同的实现方式。

不过,我首先建议你思考一下你个人或公司能接触到的所有信息来源。例如包括:

  • 会议记录
  • 你的项目管理工具,如Linear
  • 你的代码代理工具,如Claude Code或Codex。你最近用这些模型完成了哪些工作(以及哪些任务已完成)
  • 办公室的面对面讨论

你可能还能想到许多其他信息来源。当然,这在一定程度上取决于你的工作方式和工作环境。关键是你要绘制出所有这些不同的信息来源,并找出一种自动将这些来源的信息路由到知识库中的方法。

你和其他人都不愿意花更多时间手动将信息输入知识库。你需要找出一种自动完成的方式,以确保知识库始终保持最新。

确保从信息源到知识库的信息路由过程完全自动化非常重要。如果你需要手动步骤(例如将会议记录粘贴到知识库中),你肯定会忘记这一步,导致重要上下文丢失,这与知识库的整个概念背道而驰。知识库的全部意义在于你将所有信息都存储在那里,不遗漏任何内容。这就是知识库如此强大的原因。

例如,对于会议记录,你可以设置一个定时任务每天同步。它会获取公司每个人或你自己所有的会议记录,并将其存储到知识库中。你可以为Linear或项目管理工具设置类似的定时任务,同步所有发生的事情。将代码代理工具与你正在处理的内容进行同步,以及与代码代理工具讨论过的内容等。所有这些都可以通过每天的定时任务轻松同步到知识库中。

办公室的面对面讨论是较难完全自动化的点。我自己尚未完全解决这个问题,但有两个可能的方案:

  • 持续记录所有发生的事情,当然这需要获得同意
  • 或者在办公室讨论后手动记录下讨论内容

然而,我认为你甚至可能不需要显式存储办公室讨论内容,因为大多数时候在我与他人进行面对面的办公室讨论后,对方或我本人会从讨论中提取上下文并将其写入他们的编码代理中。这种讨论通常是因为某个实现问题,因此如果这些知识之后被你的编码代理主动使用,你可以从编码代理日志中获取这些信息。

如果你成功完成这一步并将每天遇到的所有上下文都存储到知识库中,那么你已经完成了大部分工作。知识库的构建是其中最具挑战性的部分。在下一节中,我将介绍更简单的部分,即在做决策或与编码代理交互时,如何主动使用知识库中的信息。

从知识库中利用信息

如果你已经同步了包含所有所需信息的知识库,现在可以进入主动利用这些信息的阶段。我认为利用知识库信息主要有两种方式:

  • 当你有疑问时,可以直接查询知识库。当然,这应该通过你的编码代理来完成。你向它提问时,它应该知道需要查询知识库来寻找答案。
  • 第二种方式是让编码代理在执行任何工作时(例如进行代码实现、修复漏洞等)被动利用知识库。

我认为第一种方法已经很明确。只要在不确定时直接提问即可。因此我会花更多时间讨论第二种方法。

让编码代理在执行工作时被动利用知识库,例如进行代码实现、修复漏洞等。这种方法非常强大。同样,我认为实现这一点主要有两种方式:

基于grep的推理

一种方式是在知识库中创建一个顶级markdown文件,用于解释整个知识库的结构和不同信息的位置。当然,每次向知识库添加新信息时,都需要更新这个文件。

这种方法的优势在于使用grep,它通常比基于嵌入的搜索更强大,因为grep能更有效地在需要时找到正确信息。然而,这也要求你必须将该markdown文件作为上下文持续提供给使用的LLM。这个markdown文件可能会变得非常大,经过一段时间后可能会出现问题。

基于嵌入的推理

主动使用知识库的第二种方式是基于嵌入的推理。这也是GBrain的设计初衷。基本原理是,每次运行查询时,都会执行嵌入搜索(类似对知识库的RAG检索),从知识库中获取相关片段。如果LLM认为通过嵌入搜索获取了相关信息,它可以进一步查看相关文件。

我认为这可能是在推理过程中使用知识库更优的方式,因为它不需要主动搜索,也不需要为所有操作消耗大量输入令牌来访问知识库。

然而,哪种方法效果最好,最终还是取决于你的具体使用场景。

结论

总而言之,我建议你:

  • 尝试建立一个知识库
  • 尽可能多地将信息写入其中
  • 阅读他人是如何构建这些知识库的
  • 尝试自己动手搭建

然后,你应该在使用编码代理进行计算机工作时(基本上你做的所有工作都应该如此)积极使用这个知识库。我相信在未来几年,知识库将变得极其强大且有价值,它也能为你提供竞争优势,因为拥有大量信息的访问权限在未来将是一个明确的优势。此外,这些数据是特定于你公司或你个人背景的,在许多情况下,只有你才能访问这些信息。因此,如果你不存储它们,将来就再也无法访问这些信息了。

👋 联系我

👉 我的免费电子书和网络研讨会:

🚀 通过大语言模型将你的工程效率提升10倍(免费3天电子邮件课程)

📚 获取我的免费视觉语言模型电子书

💻 我关于视觉语言模型的网络研讨会

👉 在社交媒体上找到我:

💌 Substack

🔗 LinkedIn

🐦 X / Twitter

撰写者

查看 Eivind Kjosbakken 的所有文章

信息检索

知识库

大语言模型代理

大语言模型应用

机器学习

分享本文

  • 在 Facebook 上分享
  • 在 LinkedIn 上分享
  • 在 X 上分享

Towards Data Science 是一份社区出版物。提交你的见解以触达全球受众,并通过 TDS 作者支付计划获得收益。

更新为你的实际提交URL

为 TDS 撰写文章

✦ 结束 CTA ✦