\n\n### 最新文章\n\n- Python中使用Claude API入门 2026年你应该了解的10个智能体AI框架 人类的最后一次考试是个干扰项 无需头疼即可构建应用的5个AI编码平台 使用本地AI系统:Qwen3.6 + MCPs 2026年你可以构建的7个现实Python项目(附指南)\n\n## 热门文章\n\n- 为开发者提供最佳价值的5个AI编码订阅计划\n\n- 2026年你应该了解的10个智能体AI框架\n\n- 2026年可构建的7个真实世界Python项目(附指南)\n\n- 5种智能体工作流实现数据科学流水线自动化\n\n- 你的RAG流水线可能毫无用处。这里有一个更好的替代方案\n\n- 2026年可本地运行的7大编程模型\n\n- 构建本地AI系统:Qwen3.6 + MCPs\n\n- 2026年成为AI架构师的发展路线图\n\n- 在Apple Silicon上使用MLX微调语言模型\n\n- 5个无需头痛即可构建应用的AI编程平台\n\n#content_wrapper end\n\n© 2026\n\nGuiding Tech Media\n\n|\n\n关于\n\n联系我们\n\n广告合作\n\n隐私政策\n\n服务条款\n\n2026年7月2日由Iván Palomares Carrascosa发布\n\nblank\n\n不,谢谢!\n\n/.main_wrapper\n\n\n\nnoptimize\n\n/noptimize","speakable":{"@type":"SpeakableSpecification","cssSelector":["[data-speakable='summary']","[data-speakable='takeaways']"]},"author":{"@type":"Organization","name":"KDnuggets","url":"https://www.kdnuggets.com"},"publisher":{"@type":"Organization","name":"traeai","url":"https://www.traeai.com","logo":{"@type":"ImageObject","url":"https://www.traeai.com/icon.svg"},"sameAs":["https://github.com/cq0206/traeai"]},"mainEntityOfPage":"https://www.traeai.com/articles/30ac1edb-4aae-4a73-a531-ffb52c5f9c12"},{"@type":"WebSite","@id":"https://www.traeai.com/#website","url":"https://www.traeai.com","name":"traeai","description":"traeai 为开发者、研究员和内容团队筛选高质量 AI 技术内容,提供摘要、评分、趋势雷达与知识库产出。","inLanguage":["zh-CN","en"],"potentialAction":{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https://www.traeai.com/?q={search_term_string}"},"query-input":"required name=search_term_string"}},{"@type":"BreadcrumbList","@id":"https://www.traeai.com/articles/30ac1edb-4aae-4a73-a531-ffb52c5f9c12#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"首页","item":"https://www.traeai.com/"},{"@type":"ListItem","position":2,"name":"文章","item":"https://www.traeai.com/brief"},{"@type":"ListItem","position":3,"name":"KDnuggets","item":"https://www.traeai.com/sources"},{"@type":"ListItem","position":4,"name":"Humanity’s Last Exam is a Distraction","item":"https://www.traeai.com/articles/30ac1edb-4aae-4a73-a531-ffb52c5f9c12"}]}]}
KDnuggets

Humanity’s Last Exam is a Distraction

6.9内容质量

TL;DR · AI 摘要

Humanity’s Last Exam is a Distraction - KDnuggets publ: 2-Jul, 2026 - Blog Top Posts About - Topics AI Career Advice Com...

核心要点

  • 主题聚焦:Humanity’s Last Exam is a Distraction
  • 来源:KDnuggets,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#前端#后端#安全
打开原文

Humanity’s Last Exam 是一种干扰 - KDnuggets

publ: 2026年7月2日

  • 博客热门文章
  • 主题 AI 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
  • 数据集
  • 活动
  • 资源 快速参考指南 推荐 技术简报
  • 广告

订阅时事通讯

#header end

/ad_wrapper

Humanity’s Last Exam 是一种干扰

本文将深入探讨终极AI系统评估基准,说明其创建原因,汇总领域专家对该基准的多样化观点,并总结最广泛接受的结论。

作者:

Iván Palomares Carrascosa

,KDnuggets技术内容专家,2026年7月2日发布于

人工智能

<div class="addthis_native_toolbox"></div>

# 引言

Humanity's Last Exam (HLE) 是一个旨在衡量现代AI系统推理和深度知识能力的基准测试。其显著特征在于其评估方式被推向极端。可以将其视为当代图灵测试的演变,而图灵测试诞生于几十年前。

本文将深入探讨这一基准测试,说明其创建原因,汇总领域专家的多样化观点,并总结最广泛接受的结论。

# 为什么创建HLE,它包含哪些内容?

随着经典AI系统不断进化并开始轻松取得完美成绩,传统测试方法已变得过时。因此,AI安全中心联合Scale AI,并在世界专家的帮助下,创建了一个名为HLE的新基准测试。该基准测试于2026年1月发表在《自然》期刊上,这是迄今为止最负盛名的科学期刊。它经过精心设计,避免了之前评估框架中重复模式的问题。

那么,HLE具体涉及什么?简单来说,这是一场面向最先进AI系统(如语言模型)的考试,包含超过2500道专家级问题,涵盖超过一百个学术领域,包括但不限于物理、数学、生物学、人文学科等。重要的是,这些问题无法通过记忆回答,也不局限于简单的信息检索或多项选择题。相反,它们要求复杂的演绎推理和深入的理解。

以下是两个此类问题的示例:

两个示例HLE问题。图片来源:AI安全中心

让我们看看目前最先进模型的表现结果:即使是最先进的前沿模型,如GPT、Gemini或Claude,整体准确率也仅勉强超过45-50%。这些数据充分说明了考试的难度之高。此外,这些模型常常因在回答错误问题时表现出过度自信而失败。

在大规模应用中,关于HLE存在三个主要的观点群体:

#### // 1. HLE确实具有实用价值且不可或缺

根据调查,约60%的意见倾向于这一群体。他们认为当前HLE之所以重要,存在技术层面的原因:此前用于AI系统的基准测试框架(包括不算太老旧的语言模型基准测试如Massive Multitask Language Understanding(MMLU))已趋于饱和或过时,几乎所有现代AI在这些测试中得分都超过90%。这使得人们无法真正比较最新模型之间的优劣,无法判断哪个模型更优秀。许多专家赞赏HLE的一个显著原因是,它能衡量AI是否愿意承认"我不知道",而不是对复杂问题或无法回答的问题进行胡编乱造。

#### // 2. HLE是真正AI发展的干扰项

这一怀疑论观点被约30%的意见所采纳。这些专家认为该测试并不能真正评估AI在日常场景中的性能和成功表现,其测试内容完全基于过于学术化和晦涩的知识。一些工程师甚至讽刺地表示,一旦AI在HLE测试中大规模得分超过90%,企业就会急于推出HLE 2,以此类推,从而形成有利于大公司的营销轮子。

#### // 3. HLE存在缺陷

这是三个主要观点中最小的群体,目前在数据科学论坛中正在讨论这一问题。他们指出HLE在某些被标记为正确的答案中存在错误,特别是在化学和高等数学等领域的某些冷门问题上。颇具讽刺意味的是,这些错误最早竟是由最强大的AI系统本身检测出来的。

# 总结

总而言之,HLE的实用性并未被否认,许多专家在一定程度上强调了其重要性,尽管其名称被广泛认为是纯粹的营销噱头。利用这一基准测试似乎不太可能决定超级AI的诞生或真正的人工通用智能(AGI)的出现:这个概念已经讨论了很多年,但至今仍更多属于虚构而非现实。尽管如此,该基准测试仍被视为一个非常雄心勃勃的工具,用于辨别哪个AI或公司拥有具备记忆和逻辑能力的最佳模型。

Iván Palomares Carrascosa是AI、机器学习、深度学习和LLMs领域的领导者、作家、演讲者和顾问。他培训和指导他人如何在现实世界中利用AI。

关于此主题的更多内容

  • AI会取代人类吗?

<hr class="grey-line"><br> <div><h3>我们推荐的5门免费课程</h3><br> </div>

Mailchimp for WordPress v4.13.1 - https://wordpress.org/plugins/mailchimp-for-wp/

/ Mailchimp for WordPress插件

您可以从这里开始编辑。

如果评论已关闭。

<= 上一篇

下一篇 =>

#content end

<script type="text/javascript">kda_sid_write(kda_sid_n);</script>

最新文章

  • Python中使用Claude API入门 2026年你应该了解的10个智能体AI框架 人类的最后一次考试是个干扰项 无需头疼即可构建应用的5个AI编码平台 使用本地AI系统:Qwen3.6 + MCPs 2026年你可以构建的7个现实Python项目(附指南)

热门文章

  • 为开发者提供最佳价值的5个AI编码订阅计划
  • 2026年你应该了解的10个智能体AI框架
  • 2026年可构建的7个真实世界Python项目(附指南)
  • 5种智能体工作流实现数据科学流水线自动化
  • 你的RAG流水线可能毫无用处。这里有一个更好的替代方案
  • 2026年可本地运行的7大编程模型
  • 构建本地AI系统:Qwen3.6 + MCPs
  • 2026年成为AI架构师的发展路线图
  • 在Apple Silicon上使用MLX微调语言模型
  • 5个无需头痛即可构建应用的AI编程平台

#content_wrapper end

© 2026

Guiding Tech Media

|

关于

联系我们

广告合作

隐私政策

服务条款

2026年7月2日由Iván Palomares Carrascosa发布

blank

不,谢谢!

/.main_wrapper

<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>

noptimize

/noptimize