How to measure human-LLM judge alignment
TL;DR · AI 摘要
本文提出系统性方法衡量LLM评估者与人类判断一致性,通过三个核心问题和六步流程提升评估可靠性。
核心要点
- 使用Cohen’s kappa等指标报告人类间一致性,避免高估实际水平
- LLM与人类一致性对比需用相同指标,人类一致性作为背景而非上限
- 创建参考标准时应保留低共识案例,而非随意分配标签
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 衡量人类与LLM评估者一致性
- 核心问题
- 人类可靠性评估
- LLM与人类一致性对比
- 错误类型分析
- 实施步骤
- 任务定义参数设置
- 人类注释数据收集
- 参考标准创建方法
- LLM分类器评估指标
金句 / Highlights
值得收藏与分享的关键句。
No single number can tell you whether an LLM judge is trustworthy.
Report raw human–human agreement alongside a chance-adjusted metric such as Cohen’s kappa.
Create the reference through adjudication or a true majority vote. Preserve ties and low-consensus cases.
Treat human agreement as context for the comparison, not as a hard performance ceiling.
如何衡量人类与LLM评估者的一致性 - Arize AI
如何衡量人类与LLM评估者的一致性
发布于2026年7月22日
LLM评估者使大规模数据集的快速评估成为可能,但在依赖某个LLM评估者之前,你需要了解其判断与人类专家的匹配程度。
没有任何单一数字能告诉你LLM评估者是否值得信赖。在信任评估者之前,你需要了解任务本身是否定义清晰,评估者是否在人类判断的观察范围内正确应用评分标准,以及它在哪些方面出现偏差。这些问题各不相同,每种情况都需要不同的衡量方式。
完整的评估一致性度量可以分解为三个问题:
- 人类在多大程度上能够可靠地应用评估标准?
- LLM与人类达成一致的频率是否与人类之间的一致性相当?
- 当LLM与参考判断不一致时,它会犯哪些类型的错误?
本指南将帮助你回答这些问题,并为你的场景选择合适的评估方法。
TL;DR
- 在代表性样本上收集多个人类标注,利用标注差异识别标准中的问题,并建立更可靠的参考基准。
- 在报告原始人类一致性时,同时使用经过机会调整的指标(如Cohen’s kappa、Fleiss’ kappa或Krippendorff’s alpha,具体取决于标注设置)。
- 使用相同指标比较人类之间和LLM与人类在相同示例上的一致性。将人类一致性视为比较的背景,而非性能上限。
- 通过仲裁或真正的多数投票创建参考基准。保留低共识案例而非随意分配标签。
- 将LLM评估者视为分类器,针对参考基准报告精确率、召回率、F1值、类别数量和混淆矩阵。
- 确保每个重要类别(而不仅仅是整个数据集)都有足够的样本,并报告主要结果的不确定性。
第一步:在选择指标前定义任务
首先写下以下四项内容:
unit: span | trace | session
labels:
type: nominal | ordinal | multilabel
values: [pass, fail] # 或有序列表
positive_class: fail # 用于精确率/召回率
reference_policy: majority | adjudicate | soft_label
cost_asymmetry: fp_worse | fn_worse | equal单位:单个判断对象是什么?是单个LLM调用(span)、对话中的步骤序列(trace)还是整个对话(session)?
标签结构与测量级别:任务是单标签还是多标签?如果是多标签,类别是名义型还是序数型?三个名义型标签(如幻觉、不相关、不完整)没有内在顺序,而三个序数型标签(如失败、部分通过、通过)具有顺序。
正类:对于精确率和召回率,哪个标签代表你试图检测的事件?
参考策略:多个人类判断如何转化为可操作的参考基准?例如多数投票或专家仲裁?
错误成本:假阳性还是假阴性更具后果性?
这些决策决定了哪些指标具有意义。
第二步:衡量人类之间的一致性
在评估LLM评估者之前,先查看具有多个人类标注的示例。
一致性指标告诉你人们是否能一致地应用评分标准。没有指定任何人的判断是正确的,所有判断均对称处理。
一个实用的起点是:
标注设置
良好的起点
两名标注者,分类标签
Cohen’s kappa
两名标注者,有序标签
加权Cohen’s kappa
三名或更多标注者,每项标注人数相同
Fleiss’ kappa
缺失标注或标注者数量不一致
Krippendorff’s alpha
有序标签存在缺失或标注不一致
序数Krippendorff’s alpha
任意设置
原始百分比一致性作为描述性补充指标仍然有用。
Cohen’s kappa支持二分类和多分类任务;它不仅限于通过/失败的判断。有关如何配置此指标的示例,请参阅Scikit-learn的文档。
当标注覆盖率不均衡时,Krippendorff’s alpha是最灵活的选择。它支持多种测量级别、标注者数量不一致以及缺失判断。R Journal的概述提供了详细解释。
为什么要收集多个人类标注?
多个人类标注有三个作用。
首先,它们能为您提供更多构建参考标签的证据。单个标注可能反映错误、非常规解读或个人偏见。多个判断使您能够识别共识、裁定分歧或保留意见分布。
它们不会自动创建黄金标准。它们为操作参考提供了一个更有说服力的基础。早期Arize关于评委一致性的覆盖内容(包括《评判评委》)涵盖了相关失败模式;基于人类分歧的上下文图构建展示了如何利用这些分歧。
其次,分歧可以帮助您改进评估标准。低一致性可能表明:
- 评分标准存在歧义。
- 标注者需要更好的示例。
- 缺少相关上下文。
- 单个标签合并了多个概念。
- 任务包含合法的主观性。
一致性分数能识别问题的存在。分歧本身能帮助您理解需要修改的内容。
第三,人类一致性为解释评委提供了上下文。当合格人员定期对相同示例做出不同解读时,完美的人类-LLM一致性可能既不现实也不可取。
将标注作为评估开发的一部分
一个实用的开发循环如下:
- 让多个人类标注一个具有代表性的校准数据集。
- 计算一致性并检查分歧。
- 修订标准、示例或标注流程。
- 进行另一轮校准。
- 一旦标准稳定,锁定最终测试集。
这就是我将标注视为评估开发的一部分,而不仅仅是评分的原因。已经大规模收集人类反馈的团队也可以借鉴OpenAI如何将用户反馈转化为产品改进的模式。
是否应该报告原始百分比一致性?
是的——原始百分比一致性易于理解,但它没有考虑随机机会、单个标注者分布或类别不平衡,因此应与经过机会调整的指标一起报告。
假设您有100个示例,其中95个通过。一个标注者识别出五个失败案例;另一个将所有案例标记为通过。尽管第二个标注者从未发现任何失败案例,他们仍然在数据集的95%上达成一致。
调整后的指标(如kappa)会考虑标注者的标签分布。但kappa本身也存在一些问题:严重的类别不平衡可能导致kappa值异常偏低,即使原始一致性很高,这种现象被称为kappa普遍性悖论,已被广泛记录。Feinstein和Cicchetti对此进行了描述。
实际解决方案是同时报告以下多个指标:
- 原始一致性
- Kappa或alpha值
- 标签数量或百分比
- 混淆矩阵或主要分歧模式
避免依赖通用阈值判断,例如“0.6是好的”或“0.8是可接受的”。一致性水平是否足够,取决于任务的模糊性、错误决策的风险以及判断结果的使用方式。
第3步:将人类一致性作为LLM的基线
如果人类标注者之间无法完全达成一致,也不应期待LLM与人类之间能实现完美一致性。
为进行清晰对比,需计算LLM与每位人类标注者之间的成对一致性。
假设人类标注者A、B、C与LLM对相同示例进行标注:
首先计算人类之间的一致性:
- A ↔ B
- A ↔ C
- B ↔ C
然后计算LLM与人类之间的一致性:
- LLM ↔ A
- LLM ↔ B
- LLM ↔ C
报告每个成对结果及其平均值或范围。
例如: 人类之间成对一致性范围为69%至75%,平均值为72%。LLM与人类之间成对一致性范围为68%至71%,平均值为70%。
这表明LLM的表现接近人类可复现范围。
注意不要将LLM加入标注池并报告综合的人类+LLM alpha或Fleiss' kappa值。这会回答一个实用性较低的问题——"这个混合小组的可靠性如何?",而无法直接将LLM与人类基线进行对比。
需要特别注意的是,人类一致性只是一个基线,而非性能上限。模型可能比个体标注者之间的一致性更频繁地与稳定共识参考达成一致,尤其当个体标注包含噪声时。模拟研究已表明,标注者间一致性并非模型性能的必然上限。
评估判断者的自洽性
如果判断者是非确定性的,需在相同示例上运行多次。
一个平均与人类一致但每次运行结果都变化的判断者,可能难以在监控、实验或发布门禁中可靠使用。
需同时报告:
- 判断者与人类参考的一致性
- 判断者多次运行之间的一致性
同时记录模型版本、评估者提示语、推理设置和评估日期。当未对判断者配置进行版本控制时,评分难以复现。提示语设计也会影响判断者可靠性——参见LLM-as-a-Judge的基于证据的提示策略。
第4步:将人类判断转化为参考标准
下一步是为每个示例创建一个参考结果。
这会改变评估关系。人类之间的一致性是对称的,但一旦定义操作参考标准,比较就变为非对称关系:
- 人类汇总或裁定标签 = 参考标准
- LLM判断 = 预测结果
可能的参考策略包括:
- 专家裁定
- 多数投票
- 预定义的平局解决流程
- 共识会议
- 保留分布而非强制硬标签
二分类任务
拥有三个完整的通过/失败标注时,多数投票总能产生结果。
使用两名标注者时,所有分歧都将被视为平局。应引入第三名标注者或仲裁机制,而非单方面采纳某一方的标签。
多类别任务
当存在三个标签和三名标注者时,每位标注者可能选择不同类别。这种情况无法形成有意义的多数意见。
建议对这些情况实施仲裁或标记为模糊。若强制指定硬标签,应保留投票统计结果以便区分:
- 3-0:强共识
- 2-1:弱共识
- 1-1-1:无共识
还可分别报告LLM在高共识和低共识样本上的性能表现。这有助于判断仲裁者是未能识别明确案例,还是参与了合理的模糊判断。
第5步:将LLM仲裁者视为分类器
获得参考标签后,关系将变为不对称:
- 人类共识 = 参考标签
现在可报告分类指标。如需实际对比标签格式的实践案例,请参阅[测试二分类与评分评估](testing binary vs. score evals)。
二分类任务
选择重要的正类(通常是失败类),并报告:
- 精确率
- 召回率
- F1
- 混淆矩阵
- 支持度(每个类别中的样本数量)
多类别任务
报告以下内容:
- 每个类别的精确率、召回率和F1
- 宏F1
- 若有必要,加权F1
- 完整的混淆矩阵
宏F1为每个类别赋予相同权重,有助于发现对罕见但重要标签的性能缺陷。加权F1赋予常见标签更多影响,可能掩盖罕见类别的失败情况。在常规单标签多分类任务中,微F1等同于准确率,因此通常贡献有限。Scikit-learn在此处解释了平均选项。
解释:
- 精确率低:误报过多;仲裁者可能过于敏感
- 召回率低:漏报过多;仲裁者未能识别真实失败
- F1:总结精确率-召回率权衡
对于有序标签,还需考虑加权Kappa或误差距离度量。将通过与部分混淆可能比将通过与失败混淆更不严重。
仍可报告LLM-参考标签的百分比一致性和Kappa值。它们能与人类基线保持连续性。精确率、召回率和F1提供错误诊断信息。
分类指标解读
这些指标揭示了仲裁者不同的失败模式。
精确率提问:在仲裁者标记为失败的案例中,有多少是参考标签认定的失败?精确率低意味着仲裁者产生过多误报。可能是过于敏感或过度应用评分标准。
召回率提问:在参考标签认定的失败案例中,仲裁者发现了多少?召回率低意味着仲裁者遗漏了真实失败。
F1将精确率和召回率合并为一个指标,默认赋予相同权重。当失败案例较少时,它通常比准确率更具信息量。它适用于整体性能比较,但不应取代混淆矩阵或对错误成本的明确讨论。
若漏报成本更高,应优先考虑召回率或使用赋予召回率更高权重的F分数(如F2)。若误报成本更高,应优先考虑精确率或使用赋予精确率更高权重的F分数(如F0.5)。
指标应反映仲裁者将支持的操作决策。
需要多少示例?
没有统一的最低要求。所需样本量取决于:
- 预期性能
- 类别平衡
- 标签数量
- 标注者数量
- 期望的精确度
- 您是正在估算一个指标还是验证一个主张
对于像原始一致性这样的简单比例,95%置信度下的一个有用最坏情况近似是:
- 约100个独立示例可实现约±10个百分点的误差范围
- 约400个示例可实现约±5个百分点的误差范围
这些数据来自比例的标准样本量计算公式。NIST提供了基础公式。
将这些视为直觉而非保证。Kappa和F1的不确定性更复杂,稀有类别通常是真正的限制因素。
按类别统计示例数量,而不仅仅是总示例数
假设失败案例仅占数据的5%。一个包含200个示例的测试集平均仅包含约10个失败案例。无论总样本量听起来多么令人印象深刻,您的召回率估计都将极其不稳定。
精确度取决于预测的正例数量,召回率取决于实际的正例数量。确保两个分母都包含足够多的示例以支持您想要得出的结论。
一个合理的流程启发式方法是:
- 使用30-50个具有多重标注的代表性示例进行早期评分标准迭代
- 将约100个示例的结果视为方向性参考
- 为稳定的基准测试,应围绕期望的置信区间宽度和每个重要类别的预期数量进行规划
如果通过增加失败案例来丰富数据集以获得更好的类别覆盖,请明确说明。在人工平衡的数据集上测量的精确度可能无法代表生产环境的精确度,因为生产环境的分布不同。您可以维护一个自然分布的测试集和一个独立的失败案例专项测试集。
报告不确定性
40个示例得出的0.78得分与4000个示例得出的0.78得分含义不同。
请围绕主要指标报告95%置信区间。对于Kappa、Alpha和F1,对示例进行自助采样是一个实用选项。如果多个片段来自同一跟踪或对话,请对整个跟踪进行重采样——而非单个片段——以确保相关示例保持在一起。
当比较两位标注者在相同示例上的表现时,请使用配对自助采样:一次性重采样示例,并重新计算两位标注者的得分及其差异。
即用型方案
根据标注设置:
推荐方法
每个示例由一个人标注
测量LLM-参考的精确度、召回率和F1,但需注意参考标注的可靠性未知。如果可能,对代表性子集进行双重标注。
每个示例由两个人标注
报告原始一致性及Cohen's Kappa。裁定分歧,分别将LLM与每位标注者进行比较,并使用裁定后的参考数据计算分类器指标。
每个示例由三人或更多人完整标注
报告原始一致性及Fleiss' Kappa或Krippendorff's Alpha。计算成对的人际一致性及LLM-人际一致性以进行匹配比较。仅在存在真实多数意见时使用多数投票;裁定平票及无共识案例。
标注数量因示例而异
使用Krippendorff's Alpha报告整体人际可靠性。对于匹配的LLM基准,计算所有人类与LLM对同一示例进行标注的成对一致性。检查缺失标注是否集中在困难示例中。
根据标签结构:
标签结构
附加分析
多类别
报告每类指标、宏F1、类别数量及混淆矩阵。检查哪些类别经常被混淆。
有序类别
使用加权Cohen’s kappa衡量两名评估者的一致性,或使用序数Krippendorff’s alpha衡量多名评估者的一致性。采用能够保留分歧严重程度的分析方法。
最终报告中应包含的内容
至少应记录以下信息:
- 被评估的单元
- 标签定义及其是名义变量还是序数变量
- 示例数量和标签分布
- 每个示例的标注人数
- 人类之间原始一致性及kappa或alpha值(包含不确定性)
- 在相同子集上LLM与人类之间的成对一致性
- 人类标签的聚合或裁定方式
- LLM与参考标准的精确率、召回率、F1值及混淆矩阵
- 按类别和人类共识水平划分的性能表现
- 重要的分歧模式及评分标准变更
如果LLM评估者具有非确定性,还需重复评估以衡量其在不同运行中是否与自身一致。
在Arize AX中实践该工作流程
实际的人类-LLM评估者验证工作流程包含四个部分:
- 收集具有代表性的示例
- 校准人类标注流程
- 在保留数据集上运行评估者
- 分析分歧并版本化生成的评估器
Arize AX支持对应用数据和实验结果进行人类标注,以及LLM-as-a-Judge评估器用于自动化评分。标注队列可以将定义的数据集和标注标准分发给领域专家,使结构化人类反馈的收集更加容易,并识别自动化评估与人类判断存在分歧的示例。
从具有代表性的校准数据集开始。要求多名标注者应用草稿评分标准,计算一致性并检查重复出现的分歧。修订标准和示例,直到评分标准具有足够的可复现性。
随后冻结评分标准并标注完整数据集,裁定分歧。运行LLM评估者处理该数据集,并将其标签与个体人类判断和聚合参考标准进行对比。
在Arize AX中,评估器可以在跨度、追踪、会话或实验级别返回结构化标签、评分和解释。评估器支持版本控制,使团队能够跟踪评分标准、提示语、判断模型和配置随时间的变化。
利用该版本控制功能保留清晰的记录:
- 生成每个结果的评估器
- 使用的提示语和模型配置
- 运行的的数据集版本
- 评估器版本之间的变更
- 变更是否提升了保留基准测试的性能
聚合得分只是起点。审查分歧,按类别和共识水平进行筛选,判断评估者是否因评分标准不明确、上下文缺失、提示语过于宽泛或模型真实局限性而失效。
核心要点
一致性指标和分类指标具有互补性:
- 人类之间的一致性告诉你评估标准是否可复现
- LLM与人类之间的一致性告诉你评估者是否在人类变异范围内运行
- LLM与参考标准的分类指标告诉你评估者哪里出错了
或者更简单地说:
- 使用人类分歧来强化评估
- 使用一致性指标来为评估者提供上下文
- 使用分类指标来诊断评估者
这些指标中没有任何一个单独证明评分标准衡量了正确的事物。这仍然需要代表性数据、领域专业知识、对分歧的仔细审查,以及对评估者输出使用方式的清晰理解。
<div class="container pt-12"> <div class="max-w-[1200px] mx-auto"> <div class="flex items-center justify-between"> <h4 class="font-sans text-24/[120%] md:text-36/[120%] font-light text-content-primary-light dark:text-content-primary-dark">相关文章</h4> </div> <div class="flex gap-6 mt-6 md:flex-row flex-col"> <div class="flex-1"> <a href="https://arize.com/blog/introducing-adb-arizes-proprietary-olap-database/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="156" src="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" srcset="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif 300w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1024x533.avif 1024w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-768x400.avif 768w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1536x800.avif 1536w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-2048x1067.avif 2048w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-260x135.avif 260w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-520x271.avif 520w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-845x440.avif 845w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1690x880.avif 1690w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1366x711.avif 1366w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-77x40.avif 77w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-154x80.avif 154w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1530x797.avif 1530w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-150x78.avif 150w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">介绍 adb:Arize 的专有 OLAP 数据库</h4> </a> </div> <div class="flex-1"> <a href="https://arize.com/blog/introducing-adb-arizes-proprietary-olap-database/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="156" src="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" srcset="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif 300w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1024x533.avif 1024w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-768x400.avif 768w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1536x800.avif 1536w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-2048x1067.avif 2048w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-260x135.avif 260w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-520x271.avif 520w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-845x440.avif 845w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1690x880.avif 1690w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1366x711.avif 1366w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-77x40.avif 77w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-154x80.avif 154w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1530x797.avif 1530w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-150x78.avif 150w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">介绍 adb:Arize 的专有 OLAP 数据库</h4> </a> </div> <div class="flex-1"> <a href="https://arize.com/blog/introducing-adb-arizes-proprietary-olap-database/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="156" src="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" srcset="https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-300x156.avif 300w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1024x533.avif 1024w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-768x400.avif 768w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1536x800.avif 1536w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-2048x1067.avif 2048w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-260x135.avif 260w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-520x271.avif 520w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-845x440.avif 845w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1690x880.avif 1690w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1366x711.avif 1366w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-77x40.avif 77w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-154x80.avif 154w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-1530x797.avif 1530w, https://arize.com/wp-content/uploads/2025/06/arize-adb-blog-cover-art-150x78.avif 150w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">介绍 adb:Arize 的专有 OLAP 数据库</h4> </a> </div> </div> </div> </div>