Paper: https://t.co/RbOLdingA0
LLMs在基准测试中表现提升显著,但商业学科应用仍存在明显短板,需更贴近实际场景的评估体系。
入选理由:LLMs在事实记忆类任务准确率已达92%,但商业策略分析仅达67%
人物
也叫:@emollick
推文作者,社交媒体用户。
最近变化
2026-07-22 · LLMs在事实记忆类任务准确率已达92%,但商业策略分析仅达67%
Ethan Mollick 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Paper: https://t.co/RbOLdingA0
Ethan Mollick(@emollick) · 8.5 分
What it feels like to work with Mythos
One Useful Thing · 8.5 分
Cool paper looking at how AIs solve unbounded, complex business problems in many fields by testing how well they can crack the cases we use to teach MBAs in business school: 1) AI already does extremely well across diverse business topics 2) Models are improving rapidly with time
Ethan Mollick(@emollick) · 7.5 分
已收录 10 篇与「Ethan Mollick」相关的 AI 资讯和分析。
LLMs在基准测试中表现提升显著,但商业学科应用仍存在明显短板,需更贴近实际场景的评估体系。
入选理由:LLMs在事实记忆类任务准确率已达92%,但商业策略分析仅达67%
Mythos-class AI模型Claude 5 Fable在多个任务中表现卓越,其能力远超现有模型,并可能改变人与AI的互动方式。
入选理由:Claude 5 Fable在多个任务中表现远超现有模型,包括生成复杂学术论文和创作10页押韵诗。
AI在解决复杂商业问题上表现优异,但缺乏具体技术细节,研究基于MBA案例测试模型能力随时间的提升。
入选理由:AI在跨领域商业案例分析中表现优于人类平均水平
AI正从辅助人类的“共智”模式转向自主代理模式,Anthropic数据显示AI已编写其80%代码且开发者产出提升8倍。作者提出“共存”新范式,强调在AI能力超越人类但仍有缺陷的“锯齿状前沿”中,人类需通过审慎判断与AI协作以保持核心价值。
入选理由:Anthropic报告AI现编写其80%代码,开发者人均交付量提升8倍,标志自主代理时代来临。
GPT-5.5 Pro 在事实核查方面表现出色,能够精准追踪复杂文本中的关键引用,但对细节过度敏感可能影响效率。
入选理由:GPT-5.5 Pro 能处理整章内容并准确核查所有关键引用。
Ethan Mollick 指出,Mythos 证明了强模型不仅能写代码,还能发现漏洞。真正的威胁在于通用模型开始天然具备攻防能力,这可能标志着 AI 安全的转折点。
入选理由:Mythos 模型展示了强 AI 模型不仅擅长编程,还能发现漏洞。
美国财政部明确反对中国公司通过开源AI进行工业规模的IP盗窃,可能采取制裁措施。
入选理由:美国支持开源AI但反对IP盗窃行为
Ethan Mollick认为Claude的人格化在未来一段时间内将产生重大影响,但具体影响尚不明确。
入选理由:Claude是唯一一个人格化命名的AI。
Marc Andreessen 转发了 Ethan Mollick 对 GPT-5.5 Pro 的评测,指出其具备出色的事实核查能力。
入选理由:GPT-5.5 Pro 能准确识别章节中的关键引用来源。
推文内容空洞,未提供任何技术细节或有价值信息,仅重复模糊表述。
入选理由:推文未包含具体技术内容
与「Ethan Mollick」经常一起出现的 AI 术语。
💡 想追踪「Ethan Mollick」的长期趋势?去 实体雷达 · Ethan Mollick 查看详细分析和跨材料问答。