Google Research Blog

Does better work always mean better workers?

8.5内容质量
Does better work always mean better workers?

TL;DR · AI 摘要

AI工具提升资深律师判断力但无助于初级律师技能增长,长期使用可能削弱专业知识积累。

核心要点

  • 资深律师使用AI 90天后判断力提升27%,而初级律师无显著技能增长
  • AI工具短期提升专利撰写质量但长期可能阻碍专业能力发展
  • Google实验显示AI辅助需结合人工监督才能有效培养专业判断

结构提纲

按章节快速跳转。

  1. 介绍AI在专业领域应用的双刃剑效应及研究必要性

  2. 描述对133名专利律师进行的三个月随机对照试验方法

  3. 展示AI工具在10天和90天后对专利撰写质量的提升效果

  4. 分析AI使用对不同职级律师专业判断力的差异化影响

  5. 解释AI辅助可能削弱专业知识积累的三个关键因素

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI对专业能力的影响
    • 实验设计
      • 133名律师随机分组
      • 三个月跟踪研究
    • 研究发现
      • 资深律师能力提升
      • 初级律师两极分化
      • 短期效率提升
    • 核心机制
      • 持续AI使用
      • 无辅助评估
      • 专家盲评

金句 / Highlights

值得收藏与分享的关键句。

#AI#法律科技#专业培训#研究论文#工作表现
打开原文

工作做得更好是否意味着员工更优秀?

2026年10月7日

David Autor,技术与社会访问研究员;Tanya Rodchenko,AI与经济领域负责人

在一项为期三个月的随机对照试验中,我们对执业专利律师进行了研究,发现虽然常规使用AI能整体提升工作质量,但其对在职学习的影响取决于资历:使用AI 90天的资深律师表现出更强的判断力,而未使用AI的资深律师则没有这种提升;初级律师的平均技能没有增长,他们的得分呈现出更多高分和更多低分的两极分化。

快速链接

  • 论文
  • 分享 复制链接 ×

判断力是资深专业人士与初级同行之间的关键差异。培养判断力需要数千小时的在职学习,通常通过繁琐但具有塑造性的常规工作,且通常在有经验的工作者指导下进行。但AI正在改变在职学习的方式。一方面,放射学、商业问题解决、求职者写作和法律教育领域的实证研究表明,当AI工具被精心嵌入培训流程时,经验较少的工作者可以提升其独立表现。

另一方面,最近对软件工程师、管理顾问、高中生和临床医生的实验表明,虽然AI可以作为临时外骨骼提升即时产出,但一旦移除工具,这些提升往往无法持续。理解AI如何削弱或增强专业知识需要三个很少同时具备的要素:(1)在数月而非数小时内,将持续的AI使用嵌入到普通专业工作中;(2)在AI不可用时对不受协助的判断力进行可信评估;(3)由领域专家进行盲评。

在《AI辅助是增强还是削弱专业知识?专利撰写领域为期三个月实地实验的证据》(由美国国家经济研究局出版)中,我们描述了一项实地实验,用于捕捉在高度依赖专业知识的知识产权法律领域中,AI使用导致的短期生产力和长期技能建设的变化。在我们的实验中,我们向11家与谷歌有定期非排他性业务关系的知识产权律师事务所的133名律师随机分配了当时尚未发布的Google Labs AI专利撰写助手工具(现为Gemini Notebook的一部分)。每家律所的三分之二律师(“实验组”)获得了该工具的早期访问权限,其余律师(“对照组”)仅接受了AI使用培训,直到为期三个月的研究期结束后才被允许使用该工具。

在AI辅助10天后,我们向所有参与律师寄送了一套假设发明的发明人材料包,并要求他们撰写专利申请书。90天后,我们又寄送了另一套不同的模拟发明人材料并进行了相同测试。在两个时间点上,AI工具的使用都显著提升了专利撰写表现。在10天时,AI工具使撰写得分(由独立法律专家根据五项质量维度的Likert量表评分标准进行评分)提升了0.34个标准差,相当于在对照组得分百分位排名中提升了10个位次;到90天时,这一提升扩大至0.38个标准差,对应11个位次的提升。这种提升在所有质量维度上都表现出惊人的一致性。值得注意的是,表现提升主要源于劣质评分的频率降低和优质评分的频率增加,而优秀评分的频率保持不变。从分位数分布来看,获得AI工具的律师群体得分从底部五分位数转移到了中下部和中部五分位数,但特优评分的数量没有明显变化。这一模式在初级律师群体中尤为明显,他们的质量提升同时伴随着显著的时间节省(例如在10天任务中,其平均耗时124分钟,比对照组快了18分钟)。

专利律师的工作不仅限于撰写专利,他们还需要审查彼此的工作,查找可能导致专利在法庭上无法执行的关键性错误(有时被称为"专利亵渎"),例如过度声称发明的新颖性或范围。因此我们在90天时增加了另一项任务,要求受试者对包含大量实质性及风格性错误的假设专利进行校对(手动标注并修正)。这项测试任务反映了资深律师日常工作中需要运用的专业判断,而这类判断通常无法依赖AI工具。关键的是,尽管实验组律师在撰写任务中被鼓励使用未发布的AI工具或其他AI工具,但在校对任务中禁止使用任何AI工具,这使得他们的校对得分成为衡量其技能发展程度的指标。对于所有任务(撰写和校对),我们都与第三方专利专业人士合作,根据五个质量维度对提交内容进行评分:(1)可执行性,(2)准确性,(3)战略性模糊性(主张范围的战术性界定),(4)完整性,(5)清晰度。

根据image_width确定适当宽度

对于移动设备图片,使用默认宽度

AI工具对专利撰写和校对质量的影响估计。结果涵盖所有律师(黑色正方形)、7年以下经验的初级律师(蓝色三角形)和7年以上经验的资深律师(橙色菱形)。所有估计均考虑了律所间的差异,并调整了每位律师获得评分数量的细微差异。

当移除AI工具时

当AI助手被移除后,90天的红线标注任务中均等效应消失。获得AI工具访问权限的律师在未受辅助的任务中表现优于对照组0.32个标准差(相当于百分位排名提升9个百分点),但这一效应完全由高级律师驱动,他们比对照组表现高出0.45个标准差(相当于百分位排名提升13个百分点),而初级律师则没有明显改善。相反,初级律师的得分出现两极分化:极低分增加、中等水平减少、良好表现增加,但顶尖表现者数量没有变化。

这些结果对学习意味着什么?获得AI工具访问权限的高级律师显然在过去三个月中通过使用工具显著提升了专业判断能力。但初级律师的情况更为复杂。部分得分有所提升,暗示AI可能跳过学习过程直接带来效果。其他得分则分布在分布的低端,表明在某些场景下AI可以帮助初级律师完成合格的工作,但他们的高机器辅助表现并未转化为更快掌握使高级专业人士具有独特价值的专业技能。

所有律师、7年以下经验的初级律师和7年以上经验的高级律师按经验划分的平均红线得分分布(实验组橙色/对照组蓝色)。观察值为个体评分在所有质量维度上的平均值。

分析定性编辑模式有助于理解不同经验水平的专业人士如何使用生成式AI工具。在实验组和对照组中,初级律师的提交都遵循僵化的形式主义:他们按从上到下的顺序依次处理,经常耗时在低风险的引言部分进行校对,才到达主要专利主张部分。初级律师还专注于表面级的同义词替换,而非商业范围改进。即使初级律师发现严重缺陷,他们通常也只留下描述性评论诊断问题,而不执行红线修改来修复。由于这种"诊断而不执行"的倾向在未受辅助的对照组初级律师中同样普遍,这代表了一个基础性初级律师缺陷,三个月依赖AI执行重写并未改善这一问题。

相比之下,高级律师持续受益于AI接触。实验组高级律师在红线标注上花费的时间比初级律师更长,他们跳过低风险段落,从头重建主张,剔除可能无意中缩小法律权利或限制保护范围的语言,并将许多修改与明确的法律原则配对。在后续访谈中,高级律师描述他们将AI输出视为"逻辑审计师"而非成品。这削弱了对现有文本的依恋,迫使他们阐述结构性修改的原理和方法,激活并提升其基础专业能力。

进一步研究方向

改进绩效和培养持久的专业判断是不同的目标。对于初级专业人员而言,这两者之间可能存在矛盾。基础专业知识可能是关键环节,使AI辅助的重复练习能够在职业生涯中转化为成熟的专业判断。随着模型能力的提升,这种判断仍将继续发挥重要作用:律师在与法官、客户和同事的互动中仍需依靠自身判断。他们无法在所有场景中都依赖AI工具提供帮助。当前AI时代的关键挑战在于确保今天设计的工具不会阻碍初级专业人员成长为明天所需的专家。

研究工作环境中的专业人员对研究人员而言是个挑战。我们的实验仅包含少量专利律师样本,这反映了该领域顶尖专业人士的高额小时计费率。我们仅观察他们三个月,相较于他们需要多年才能培养出持久专业能力的时间窗口,这个观察期非常短暂。此外,过去一年中模型能力的快速提升以及AI基础认知度的提高(以及法律领域AI赋能产品的普及)可能会影响结果,如果现在重新进行试验。这些局限性为后续研究创造了机会,其中一些研究我们希望在未来几个月内开展。然而,我们研究的明确结论是:要理解AI辅助对专业技能的影响,必须设计能够区分工具使用效果与用户自主表现效果的测试。

致谢

衷心感谢合著者Josh Martin、Zanna Iscenko、Scott Strand、David Pearl和Melissa Ferere;感谢James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock和Fabien Curto Millet的指导与支持;感谢Google Labs的Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng和Franz Och与我们合作进行实验;感谢Kiera Russell提供产品访问权限和受信任测试者支持;感谢Steve Gong和Taylor Montgomery在法律指导和招聘支持方面的帮助;感谢我们的Comms、Marketing和Research Blog合作伙伴Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas和Leanne Trujillo推动发布。

×

❮

❯

一组森林图,展示不同经验水平在起草和修订任务中治疗效应标准差。

比较控制组和实验组之间所有律师、初级律师和高级律师平均修订评分密度的直方图。 /think