Humanity’s Last Exam is a Distraction
TL;DR · AI 摘要
Humanity’s Last Exam is a Distraction - KDnuggets publ: 2-Jul, 2026 - Blog Top Posts About - Topics AI Career Advice Com...
核心要点
- 主题聚焦:Humanity’s Last Exam is a Distraction
- 来源:KDnuggets,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
Humanity’s Last Exam 是一种干扰 - KDnuggets
publ: 2026年7月2日
- 博客热门文章
- 主题 AI 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
- 数据集
- 活动
- 资源 快速参考指南 推荐 技术简报
- 广告
订阅时事通讯
#header end
/ad_wrapper
Humanity’s Last Exam 是一种干扰
本文将深入探讨终极AI系统评估基准,说明其创建原因,汇总领域专家对该基准的多样化观点,并总结最广泛接受的结论。
作者:
Iván Palomares Carrascosa
,KDnuggets技术内容专家,2026年7月2日发布于
人工智能
<div class="addthis_native_toolbox"></div>
# 引言
Humanity's Last Exam (HLE) 是一个旨在衡量现代AI系统推理和深度知识能力的基准测试。其显著特征在于其评估方式被推向极端。可以将其视为当代图灵测试的演变,而图灵测试诞生于几十年前。
本文将深入探讨这一基准测试,说明其创建原因,汇总领域专家的多样化观点,并总结最广泛接受的结论。
# 为什么创建HLE,它包含哪些内容?
随着经典AI系统不断进化并开始轻松取得完美成绩,传统测试方法已变得过时。因此,AI安全中心联合Scale AI,并在世界专家的帮助下,创建了一个名为HLE的新基准测试。该基准测试于2026年1月发表在《自然》期刊上,这是迄今为止最负盛名的科学期刊。它经过精心设计,避免了之前评估框架中重复模式的问题。
那么,HLE具体涉及什么?简单来说,这是一场面向最先进AI系统(如语言模型)的考试,包含超过2500道专家级问题,涵盖超过一百个学术领域,包括但不限于物理、数学、生物学、人文学科等。重要的是,这些问题无法通过记忆回答,也不局限于简单的信息检索或多项选择题。相反,它们要求复杂的演绎推理和深入的理解。
以下是两个此类问题的示例:
两个示例HLE问题。图片来源:AI安全中心
让我们看看目前最先进模型的表现结果:即使是最先进的前沿模型,如GPT、Gemini或Claude,整体准确率也仅勉强超过45-50%。这些数据充分说明了考试的难度之高。此外,这些模型常常因在回答错误问题时表现出过度自信而失败。
在大规模应用中,关于HLE存在三个主要的观点群体:
#### // 1. HLE确实具有实用价值且不可或缺
根据调查,约60%的意见倾向于这一群体。他们认为当前HLE之所以重要,存在技术层面的原因:此前用于AI系统的基准测试框架(包括不算太老旧的语言模型基准测试如Massive Multitask Language Understanding(MMLU))已趋于饱和或过时,几乎所有现代AI在这些测试中得分都超过90%。这使得人们无法真正比较最新模型之间的优劣,无法判断哪个模型更优秀。许多专家赞赏HLE的一个显著原因是,它能衡量AI是否愿意承认"我不知道",而不是对复杂问题或无法回答的问题进行胡编乱造。
#### // 2. HLE是真正AI发展的干扰项
这一怀疑论观点被约30%的意见所采纳。这些专家认为该测试并不能真正评估AI在日常场景中的性能和成功表现,其测试内容完全基于过于学术化和晦涩的知识。一些工程师甚至讽刺地表示,一旦AI在HLE测试中大规模得分超过90%,企业就会急于推出HLE 2,以此类推,从而形成有利于大公司的营销轮子。
#### // 3. HLE存在缺陷
这是三个主要观点中最小的群体,目前在数据科学论坛中正在讨论这一问题。他们指出HLE在某些被标记为正确的答案中存在错误,特别是在化学和高等数学等领域的某些冷门问题上。颇具讽刺意味的是,这些错误最早竟是由最强大的AI系统本身检测出来的。
# 总结
总而言之,HLE的实用性并未被否认,许多专家在一定程度上强调了其重要性,尽管其名称被广泛认为是纯粹的营销噱头。利用这一基准测试似乎不太可能决定超级AI的诞生或真正的人工通用智能(AGI)的出现:这个概念已经讨论了很多年,但至今仍更多属于虚构而非现实。尽管如此,该基准测试仍被视为一个非常雄心勃勃的工具,用于辨别哪个AI或公司拥有具备记忆和逻辑能力的最佳模型。
Iván Palomares Carrascosa是AI、机器学习、深度学习和LLMs领域的领导者、作家、演讲者和顾问。他培训和指导他人如何在现实世界中利用AI。
关于此主题的更多内容
- AI会取代人类吗?
<hr class="grey-line"><br> <div><h3>我们推荐的5门免费课程</h3><br> </div>
Mailchimp for WordPress v4.13.1 - https://wordpress.org/plugins/mailchimp-for-wp/
/ Mailchimp for WordPress插件
您可以从这里开始编辑。
如果评论已关闭。
<= 上一篇
下一篇 =>
#content end
<script type="text/javascript">kda_sid_write(kda_sid_n);</script>
最新文章
- Python中使用Claude API入门 2026年你应该了解的10个智能体AI框架 人类的最后一次考试是个干扰项 无需头疼即可构建应用的5个AI编码平台 使用本地AI系统:Qwen3.6 + MCPs 2026年你可以构建的7个现实Python项目(附指南)
热门文章
- 为开发者提供最佳价值的5个AI编码订阅计划
- 2026年你应该了解的10个智能体AI框架
- 2026年可构建的7个真实世界Python项目(附指南)
- 5种智能体工作流实现数据科学流水线自动化
- 你的RAG流水线可能毫无用处。这里有一个更好的替代方案
- 2026年可本地运行的7大编程模型
- 构建本地AI系统:Qwen3.6 + MCPs
- 2026年成为AI架构师的发展路线图
- 在Apple Silicon上使用MLX微调语言模型
- 5个无需头痛即可构建应用的AI编程平台
#content_wrapper end
© 2026
Guiding Tech Media
|
关于
联系我们
广告合作
隐私政策
服务条款
2026年7月2日由Iván Palomares Carrascosa发布
blank
不,谢谢!
/.main_wrapper
<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>
noptimize
/noptimize