Apple Machine Learning Research

Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs

8.5内容质量

TL;DR · AI 摘要

Glyph系统通过多策略LLM代理和RRF融合,显著提升企业数据目录的列描述生成和敏感性标签标注效率。

核心要点

  • 微调MiniLM使NDCG@10从0.55提升至0.92
  • RRF融合策略提升多标签标注F2指标1.8倍
  • 系统支持代码溯源和渐进式降级机制

结构提纲

按章节快速跳转。

  1. 揭示企业数据湖中列描述缺失导致的治理难题

  2. 描述Descriptor与Tagger双代理协同工作流

  3. 解析RAG代码溯源与三策略并行标注技术

  4. 展示MiniLM微调带来的检索性能跃迁

  5. 对比RRF融合前后的F2指标提升

  6. 强调可审计性与生产级服务设计

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Glyph系统架构
    • 核心组件
      • Descriptor代理
      • Tagger代理
    • 关键技术
      • RAG代码溯源
      • RRF融合策略
    • 评估指标
      • NDCG@10 0.92
      • F2指标提升1.8倍

金句 / Highlights

值得收藏与分享的关键句。

#数据治理#LLM代理#企业数据目录#RRF融合
打开原文

Glyph:面向企业数据目录的多策略智能代理系统——用于列描述与敏感性本体标签标注 - Apple 机器学习研究

研究领域

数据科学与标注

,

隐私

内容类型

论文

发表时间

2026年9月

Glyph:面向企业数据目录的多策略智能代理系统——用于列描述与敏感性本体标签标注

作者 Kostia Kudriavtsev, Parvez Rafi, Sha Sundaram

查看出版物

复制Bibtex

企业数据湖积累表格的速度远超人工管理员能够记录或分类的速度,导致列缺少描述且未分配治理标签。这种文档债务会削弱数据发现、访问控制和法规遵从性。我们提出了Glyph,这是一个生产系统,将两个耦合问题——列描述生成和用于数据分类的列类型标注——构造成以状态化图结构协调的协作大语言模型代理。Descriptor模块通过从企业GitHub按需检索的流水线源代码(通过推理-行动工具循环实现的主动检索增强生成技术)为每个列提供生成依据。Tagger模块通过并行运行三个互补策略(描述标签器、业务线正则表达式标签器和基于微调对比编码器的元数据标签器)来分配来自275个叶子节点的受控数据分类本体标签,然后使用倒数排名融合(RRF)技术融合它们的排名结果。我们通过批次内对比目标对6层MiniLM元数据编码器进行微调,在分布内保留测试集上,相同标签检索的NDCG@10从0.55提升至0.92(MAP@100从0.19提升至0.90),相对于原始基础编码器有显著提升。我们在三个评估组中报告了端到端多标签标注质量(基于召回加权F2目标),包括对每个策略和RRF融合的消融实验,以及将Glyph与先前列类型标注工作及商业价值/正则敏感性扫描器区分开来的工程决策:无价值依赖且基于代码的设计、按标签溯源、以及优雅降级。这些特性共同使多代理大语言模型目录系统可审计且可作为生产服务运行。

相关阅读与更新

语义正则表达式:用结构化语言自动解释大语言模型特征

2025年12月3日 研究领域 人机交互 , 研究领域 方法与算法 会议 ICLR

自动化可解释性旨在将大语言模型(LLM)特征转化为人类可理解的描述。然而,这些自然语言特征描述通常模糊、不一致且需要人工重新标注。为应对这一问题,我们引入了语义正则表达式,即LLM特征的结构化语言描述。通过结合捕捉语言和语义特征模式的原始组件与上下文化修饰符,……

阅读更多

用于音乐标注的歌词文档嵌入

2022年2月2日 研究领域 数据科学与标注 , 研究领域 方法与算法

我们针对将歌曲歌词嵌入固定维度特征以实现音乐标签的任务进行了实证研究。该研究在包含数千万首歌曲的工业级数据集上训练了五种词级表示方法和四种文档级表示方法。我们对比了预训练嵌入的简单平均方法与现代循环神经网络和基于注意力的架构。在广泛范围内进行评估……

发现机器学习领域的机遇

我们的机器学习研究每天都在取得突破性进展。

Work with us