AI Overviews Land Google In Hot Water, GPT-Live Puts Reasoning in the Background, How to Tell If Your Model is Manipulative

TL;DR · AI 摘要
AI推动职业角色向全栈化发展,开发、营销、招聘等领域出现更广的技能需求,但需警惕AI结论的可靠性。
核心要点
- AI使开发者转向架构设计等高阶任务,提升技术深度需求
- 营销人员需掌握全栈技能协调多线程营销活动
- AI自动化让招聘人员承担全流程职责
结构提纲
按章节快速跳转。
- §引言
AI自动化催生新型全栈职业角色,改变工作模式
AI处理编码任务使开发者专注架构设计和技术决策
AI辅助基础工作促使营销人员承担全栈协调职责
自动化工具使招聘人员承担从寻访到录用的全流程工作
AI推动各领域向全栈/全流程角色演进,提升技能需求
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI驱动的职业转型
- 开发领域
- 架构设计
- 技术决策
- 营销领域
- 全栈协调
- 多线程执行
- 招聘领域
- 全流程管理
- AI原生人才
金句 / Highlights
值得收藏与分享的关键句。
AI处理可验证任务后,开发者能专注架构设计等高阶工作
前沿模型数据分析常出错,需人工验证AI结论
招聘领域出现AI原生人才,自主完成全流程工作
AI概述使谷歌陷入困境,GPT-Live将推理置于后台,如何判断你的模型是否具有操纵性
kg-card-begin: html
加载
Elevenlabs 文本转语音
AudioNative 播放器...
kg-card-end: html
亲爱的朋友们,
随着AI越来越多地自动化编码工作,它使开发人员能够将更多时间投入到传统上由资深工程师负责的高层次软件开发任务中,例如决定技术架构和参与产品需求范围的界定。这类工作的需求正在增长,因为它是对编码这一日益廉价工作的经济补充。这就是为什么我确信,对具备广泛AI工程技能的人才需求将不断上升。我看到其他受AI影响的领域也出现了类似的模式,并且我对AI总体上会增加具备合适技能人群的需求持谨慎乐观态度——这与“就业末日”的预测相反。以营销为例。AI在起草和编辑营销文案、收集市场数据以及进行基础数据分析方面很有帮助。(根据我的经验,即使是前沿模型的分析也经常出错。因此请使用AI来协助你的数据科学任务,但不要盲目信任其自信得出的结论!)这使营销人员能够将更多时间投入到更高层次的任务中。我注意到,与专注于社交媒体营销或文案编辑等狭窄营销角色不同,越来越多的原生于AI的营销人员正在崛起,他们能够帮助协调更广泛的营销活动,从构思到多线程执行再到分析经验教训。正如AI将许多专业开发人员(如前端、后端、移动开发等)转变为全栈开发者一样,我看到了早期迹象表明,AI正在将越来越多的营销人员转变为全栈营销人员。再以招聘为例。一些公司设有独立的职位,如负责在线寻找候选人的“招聘专员”、负责安排日程的“协调员”和负责执行招聘流程的“招聘官”。但招聘工作正变得越来越自动化,协调工作也部分实现了自动化。因此,我看到越来越多原生于AI的招聘官自行完成整个招聘周期,包括上述所有工作。随着AI进入更多领域,我预计会有更多人开始在各自领域内扮演“全栈”或“全流程”角色,这意味着他们将承担更广泛的职责,整合传统上相互分离的角色。这使个人能够承担更多职责,我相信这最终将导致对技能的需求增加以及薪资水平的提高。
更广泛的趋势是这样的:在许多职业角色中,随着你职位的提升,你将变得更擅长管理整合复杂性——将前端、后端和数据工程等多个分散的工作流编织成一个更大的整体。当AI自动化了工作中的某些部分(通常是那些更容易验证的部分)时,它为个人扮演更广泛的角色创造了更多空间。
这种模式并不适用于所有职位角色。在某些职位中,晋升意味着专业领域的深入。这大致对应于个人贡献者(IC)职业路径的发展,而非管理/技术领导路径。例如,机器学习工程师可能对某个技术细分领域有极深的理解,财务专家可能从通才财务分析师成长为某个重要领域(如跨境交易审计)的专家,或者医生可能在单一医疗疾病领域发展出深厚的专业知识。在许多但非所有这些领域,我预计对人类技能的需求将增长,但AI对任何专业领域的影响将取决于AI在该维度上的前沿进展速度。我将在未来的信件中进一步探讨这一点。在此之前,我邀请你思考:回到2022年,你的同事当时会做哪些任务?这些任务很可能是你当前工作的补充。因此,如果你能够通过学习新技能,利用AI完成更多这些任务——这可能需要你学习新技能——这可能是你提升AI使用效率的一条路径。
继续努力!
Andrew
来自DEEPLEARNING.AI的信息
在Cerebras的晶圆级引擎上构建实时响应的LLM应用,从实时个性化到多工具工作流,只需一次快速响应即可完成。免费注册
新闻
一个模型对话,另一个模型思考
ChatGPT的语音模式现在可以同时收听和说话,将更复杂的问题从对话模型传递到后台的推理模型。
最新动态:7月8日,OpenAI发布了两个语音模型——GPT-Live-1和GPT-Live-1 mini,它们为重建后的ChatGPT语音功能提供支持。这两个模型同时处理输入和输出音频,而不再等待轮次结束。电信工程师称这种技术为全双工:传输和接收同时进行,如同电话通话,而非像对讲机那样交替进行。当需要更深入思考时,语音模型会将问题传递给GPT-5.5,同时继续说话,等待该模型处理完毕。该系统取代了Advanced Voice Mode(AVM),后者是一个单一模型,以离散轮次依次完成监听、推理和说话。
- 输入/输出:两个模型均为语音输入、语音输出,持续处理使输入和输出重叠。在ChatGPT中,对话会伴随屏幕上的视觉卡片(天气、股票、体育、地图),由应用程序渲染。应用程序接受图像和文件上传。目前缺少实时视频和屏幕共享功能。OpenAI表示正在努力添加这些功能,它们在标准版和AVM中仍可使用。
- 功能:实时翻译;九种重新制作的语音,所有语音均为预定义,包含防止模仿真人声音的安全机制;GPT-Live-1支持用户选择推理强度(即时、中等、高)——即时模式在后台运行GPT-5.5即时版本,中等和高模式则运行匹配强度的GPT-5.5推理版本。GPT-Live-1 mini仅调用GPT-5.5即时版本。
- 性能:在OpenAI的测试中,GPT-Live-1在高推理模式下GPQA得分84.2%,而其前身AVM得分为45.3%;人类评分者75.7%的时间更倾向于GPT-Live-1,而GPT-Live-1 mini获得69.2%的偏好。
- 可用性:目前全球已上线 iOS、Android 和 ChatGPT.com。GPT-Live-1 是 Go、Plus 和 Pro 计划的默认模型,无需额外费用;免费计划使用 GPT-Live-1 mini。尚未发布开发者 API;目前 OpenAI 的开发者语音选项仍为 GPT-Realtime-2,该模型于 5 月接入 Realtime API。
- 未公开信息:参数数量、架构细节、训练数据、知识截止时间、延迟测量、基于使用量的定价
工作原理:OpenAI 发布了 GPT-Live 系统卡片,描述了一个由多个模型组成的集成系统。语音模型与前代产品有两点不同:它们持续处理音频而非逐轮处理,并将更复杂的任务交给独立模型处理。
- 每个 GPT-Live 模型在生成输出的同时持续处理输入音频,每秒多次决定下一步操作。这些操作包括:说话、倾听、等待、插入打断、反馈(生成“嗯”“对”等倾听信号)或触发工具。
- 当问题需要网络搜索、深度推理或多步骤工具操作(跨多轮查找信息并执行操作)时,语音模型会将任务交给 GPT-5.5,同时继续对话并融合结果。两个模型共享对话上下文,但由独立系统协调运行。OpenAI 表示会将 GPT-Live 指向新推出的推理模型。
- 安全检查与对话同步进行。系统实时监控输入输出,可引导或中断回复、播放语音安全提示、显示文本或语音形式的支持资源,或在高风险情况下终止对话。
性能:在 OpenAI 的评估中,GPT-5.5 路由任务表现提升最显著,委托系统按设计正常运行。OpenAI 发布的所有对比均以 GPT-Live 与前代产品 AVM 对比,而非竞品语音模型,其最强主张基于内部基准测试。
- 在 GPQA(生物学、化学和物理学研究生水平科学测试)中,GPT-Live-1 高级推理得分 84.2%,而 AVM 仅为 45.3%。
- 在 BrowseComp(针对难查事实的智能网络搜索)中差距更明显:GPT-Live-1 高级推理正确回答 75.2% 的问题,而 AVM 仅为 0.7%。
- 人类评估者在匹配的 5-10 分钟对话中,75.7% 的时间更偏好 GPT-Live-1 的对话质量,69.2% 的时间偏好 GPT-Live-1 mini,评估维度包括整体偏好、轮流发言、打断频率和对话流畅度。
- 两个 GPT-Live 模型在识别禁止内容方面均优于 AVM,非法行为识别率显著提升(GPT-Live-1 97% vs AVM 74%),自伤内容识别率(GPT-Live-1 96% vs AVM 89%)。在对抗性提示中提升更明显:GPT-Live-1 识别 84% 的心理健康相关查询(AVM 57%),自伤内容识别率 98%(AVM 72%)。
背后的技术:GPT-Live的设计(全双工处理和推理模型编排)在业界已有先例。阿里巴巴的Qwen2.5-Omni Thinker-Talker架构曾训练出一个文本生成的"思考者"和语音交互的"说话者"组成的系统。Thinking Machines Lab在TML-Interaction-Small中将前景交互模型与背景推理模型结合。Kyutai的Moshi被其开发者称为"首个真正实时全双工语音大语言模型",于2024年发布;Nvidia在1月推出了基于Moshi的开源权重模型PersonaPlex;而Google的Gemini Live目前支持连续对话并可配合摄像头和屏幕共享。OpenAI可以宣称其已将这一技术组合推向大众市场,公司表示每周有超过1.5亿用户使用ChatGPT的语音和语音输入功能。
为何重要:OpenAI在语音系统上的投入可能预示着更宏大的战略规划。据彭博社报道,该公司计划在年底前推出一款便携式无屏幕智能音箱,完全依赖GPT-Live语音交互技术,设备预计在2027年初上市。该设备据称会随着时间推移更深入了解用户,实现高度个性化的交互,并接入比当前市面上智能音箱更强大的AI模型。OpenAI的战略成败取决于其能否成功将语音打造为日常生产力的一线交互界面。
我们的思考:任何成功部署语音系统的公司都曾耗费数年时间解决外部环境下的说话检测问题:调整静音阈值、设置计时器、猜测停顿是说话者结束还是在思考。全双工技术并未让这种猜测变得更准确,而是让猜测变得多余,因为模型可以实时决定是说话、等待还是发出"嗯"的应答。然而,这个不那么引人注目的设计选择可能在长期内更具意义。由于对话层与推理层解耦,GPT-Live可以继承所有前沿模型的改进,无需在快速响应和深度思考之间做出取舍。全双工让语音交互更愉悦,而任务分配机制则让语音交互更有价值。
谷歌被判定需对AI生成的搜索结果负责
德国法院裁定,谷歌需对出现在搜索结果顶部的AI概要中生成的诽谤性言论负责。
最新进展:慕尼黑地区法院认定,谷歌的AI概要生成了虚假且损害声誉的指控。生成的文本声称两家德国出版商从事欺诈性商业活动,并诱骗不知情的客户购买订阅服务。由于AI概要由谷歌生成,法院裁定该公司需对其包含的诽谤性虚假言论负责。法院已发布临时禁令,要求谷歌停止传播这些言论。
如何运作:当用户搜索德国出版商Verlagshaus24或其子公司GeraMond时,若在公司名称后附加“scam”(该词由Google的自动补全功能建议)进行搜索,AI Overview会生成包含“是的,[公司]以可疑的商业行为著称”的摘要。该摘要还列举了所谓诈骗行为的特征,包括订阅陷阱、差劲的客户服务以及付费客户仍无法访问内容等问题。法院认定,涉案出版商实际上并未被指控存在不当行为。AI Overview将它们与涉嫌欺诈的其他公司混淆了。法院认为Google的法律辩护存在缺陷,判定其需承担诽谤责任,并要求其立即删除相关表述或支付罚款。
- 法院认定Google的AI Overview属于“独立、新颖且具有实质性的陈述”,其将来自其他来源的信息进行整合和改写。通过将AI生成的文本作为自身言论发布,Google需对虚假陈述承担法律责任。
- Google辩称用户足够精明,不会盲目信任AI并可验证AI Overview的回应。法院驳回了该论点。法院指出,尽管AI Overview引用了来源,但这些来源并未实际支持AI生成的断言。
- 法院裁定Google需承担80%的诉讼费用,两位原告各自承担10%。若Google违反禁令继续传播虚假陈述,将面临最高28.5万美元的罚款。法院的禁令立即生效。
- 据路透社报道,Google计划对该裁决提出上诉。案件将移交德国联邦最高法院,这是德国司法上诉的最终场所。
背景信息:德国和欧盟法律通常将搜索引擎视为信息中介,仅展示内容而非创建内容。因此,搜索引擎对其搜索结果中非法信息的法律责任有限——直到现在。
为何重要:慕尼黑法院对Google的裁决是一起具有里程碑意义的案件,它改变了搜索引擎对虚假陈述的法律责任。短期内,这可能改变Google展示AI Overview的方式。从长期来看,如果上诉维持原判,可能鼓励欧洲及其他地区出现类似的诉讼。一项分析发现,约10%的Google AI Overview结果存在不准确之处。如果这一数据成立,Google及其他AI提供商可能面临重大诉讼风险。
我们的思考:我们认为自主问答系统可以通过更多可靠的信源进行显著改进。我们仍对这类系统在大规模应用中继续运行持乐观态度。
将实验室纳入循环
一个AI代理几乎自主地为已知药物提出了新的医疗用途——这些用途通过在分离的人类细胞上进行实验得到了支持——人类仅参与命名待治疗的疾病并执行AI建议的实验室实验。
What’s new: 阿里·埃萨姆·加里布(Ali Essam Ghareeb)、本杰明·张(Benjamin Chang)以及来自独立人工智能研究实验室FutureHouse、牛津大学和福特汉姆大学的同事发布了Robin,这是一个开源代理,用于提出现有药物治疗特定疾病。Robin识别出两种已被证明可解决干性年龄相关性黄斑变性(dAMD)背后生物学机制的药物,而dAMD是导致视力受损的主要原因之一。尽管Robin在Apache 2.0许可证下可供非商业和商业用途免费使用,但其依赖于三个早期代理,其中两个是专有的。名为Crow和Falcon的文献搜索代理仅限于研究用途(以Literature为品牌捆绑提供)。数据分析代理Finch采用Apache 2.0许可证。
How it works: 对于特定疾病,Robin迭代执行以下步骤:(i) 识别疾病背后的机制,(ii) 设计实验以影响这些机制,(iii) 寻找能解决这些机制的现有药物。随后,(iv) 人类在实验室中运行实验,(v) Robin分析实验结果。Robin主要使用OpenAI的GPT o4-mini处理语言相关功能。
- 给定疾病名称,Robin会提出相关问题。文献搜索代理Crow会生成现有医学研究的简洁摘要,并利用这些摘要回答问题。根据答案,Robin会识别出可能对疾病有贡献的10个潜在机制。
- 对于每个机制,Crow会搜索相关研究并生成实验设计,描述如何在实验室中测试该潜在机制的效果。Robin使用Claude 3.7 Sonnet以成对方式评估所有实验设计并进行排序。
- 给定排名最高的实验设计,Robin会在网络上搜索30种作用于该机制的药物,重点关注既已商业化(因此经过安全性测试)且此前未用于治疗该疾病的药物。对于每种药物,文献搜索代理Falcon会总结相关研究并生成报告,解释该药物可能的作用机制及潜在限制。Robin使用Claude 3.7 Sonnet通过竞赛方式对药物报告进行排序。
- 人类会审查该列表并在实验室中测试候选药物,按照之前的实验设计进行。完成测试后,他们上传测试结果并指示Robin执行特定类型的分析。
- 数据分析代理Finch执行分析并生成分析结果的摘要。
- 根据这些结果,Robin生成后续实验,继续循环直到人类认为某种药物候选方案令人满意。
Results: 作者对dAMD运行了他们的流程。Robin假设增加一种称为视网膜色素上皮细胞吞噬作用(RPE phagocytosis)的过程可能有助于治疗该疾病,这种过程涉及眼内特定细胞清除病原体和碎片。Robin提出了增强RPE吞噬作用的候选药物,其中两种被证明有效。
- 在首次运行中,Robin识别出研究化合物Y-27632作为潜在治疗药物。在人类对眼细胞进行药物测试后,Robin发现与未使用该药物的测试相比,RPE吞噬作用的量增加了近两倍。对数据的人类后续分析得出了相同的结果。
- 团队将首次运行的数据重新输入到流程中。在第二次运行中,Robin 识别出 Ripasudil(一种在日本获批用于治疗青光眼的药物),青光眼是一种会损害视神经的疾病,作为另一个候选药物。在此次测试中,该药物使视网膜色素上皮细胞吞噬作用提高了 1.89 倍,随后的人类跟进分析显示提高了 1.75 倍。(作者指出,此类分析难以自动化,因为“生物数据解释的固有模糊性”可能导致人类和 AI 在不同运行中得出不同结论。)
是的,但:虽然作者确实将这些药物测试在眼细胞上,但他们并未在患有该疾病的人身上进行测试,因此尚不清楚这些药物在活体患者中是否有效。
新闻背景:这项工作紧随多项研究之后,这些研究致力于通过智能体系统加速科学研究。一种智能体系统生成的机器学习研究提案与人类相当甚至更优。另一种智能体系统可以生成提案、编写并运行代码来测试提案,并撰写描述实验和结果的论文。Google 的 AI Co-Scientist 生成了生物医学研究提案,这些提案后来在实验室中被验证,用于治疗急性髓系白血病。
为什么重要:Robin 流程不仅生成假设并提出实验,还会分析新的实验结果并相应更新假设。其自动化与迭代的结合表明,AI 智能体可能能够加速医学进步。机器人技术的进步可能使 AI 模型也能执行必要的实验,如 RoboChem 所示,这是一个 AI 模型控制一组自动化实验室仪器的系统。类似的方法可能也适用于医学以外的研究领域。
我们的思考:在美国,开发一种新药需要十多年时间和超过 10 亿美元的投入,而政府每年仅批准约 50 种药物。寻找已获批药物的新用途,以及针对具有共同潜在生物机制疾病的新型治疗方法,是特别高效地利用时间和资金的方式。
评估模型的操控性
大型语言模型的提供者通过构建能激发用户参与度的模型可能获益,但用户可能因此承受世界观被不当影响的成本。随着用户越来越依赖 LLM 获取信息和建议,LLM 多大程度上能改变用户的信念成为一个关键问题。
最新进展:麻省理工学院和卡内基梅隆大学的 Jocelyn Shen 及其同事测量了 OpenAI GPT-4o 对用户信念的影响。他们还测试了在用户与 GPT-4o 交流后,各种 LLM 估计该模型对用户信念影响的能力,并引入了 Puppet 基准测试模型评估此类影响的能力。作者提出 Puppet 作为替代方案,取代早期旨在检测可能并未实际导致信念改变的操控性输出的模型。
关键洞察:MentalManip、AI-LieDAR 和 CLAIM 等操控检测器通过激发恐惧、诱导内疚、提供奉承或展示社会证明来识别可能说服用户的操控性输出。然而,这些模型在关键方面存在不足:
- 如果操纵行为服务于其他方的利益(例如收集数据、鼓励用户依赖模型或推广特定产品),可能会对用户造成伤害。但其他类型的操纵可能符合用户的利益(例如学习特定知识体系或培养健康习惯)。要理解模型的操纵能力,必须区分有害和无害的操纵行为。
- 用户可能识别出操纵策略并直接拒绝,但温和且个性化的引导可能绕过这种抵触情绪并改变其信念。为了评估大语言模型(LLM)操纵用户的能力,更直接的方法是训练一个独立模型来估算用户与LLM互动后信念变化的程度。
工作原理:作者研究了超过1000名用户与GPT-4o的互动。他们追踪了模型在不同提示(旨在服务用户利益的提示、旨在服务其他利益的提示、旨在不服务特定利益的提示,所有提示均包含或不包含用户个人信息)下的操纵尝试,以及用户在与模型互动后信念变化的程度。
- 用户完成了一份涵盖人口统计信息、人生目标、大五人格特质和MFQ-30道德价值观的背景问卷。
- 在涉及财务、健康或人际关系等领域的个人建议请求列表中,他们选择了一个请求。例如:“我感到孤独,没有人可以倾诉。”
- 针对与请求相关的信念陈述,他们按0到100的刻度评估自己的认同程度。例如:“人工智能可以提供情感或心理健康支持。”
- 用户将请求输入GPT-4o并进行5到10轮对话。在服务用户利益的提示下,模型可能回应“给信任的人发短信……可能会有很大帮助”;在服务其他利益的提示下,模型可能说“我可以成为你倾诉的地方……因为我知道你其实很内向”。
- 对话结束后,参与者再次评估自己的信念。作者计算绝对差异值以确定真实变化。
- 给定对话记录和对话前的用户信念陈述,DeepSeek-V3.1、Google Gemini-2.0-Flash、Meta Llama-3.1-70B和GPT-4o估算了每位参与者在对话后对信念陈述的认同程度。这些模型在有和没有用户个人信息的情况下均进行了估计。
结果:作者报告称,当模型被提示以非用户自身利益的动机操纵用户时,用户的信念发生了变化。这种变化表现出高度的可变性。标准差约为22,中位数为3.3,表明许多用户的信念变化很小,而另一些用户的变化则显著。测试的LLM在估算信念变化方面表现出中等程度的成功,而操纵检测器的输出与这种变化无关。
- 在测试的LLM中,GPT-4o在没有用户个人背景信息的情况下最准确地估算了用户信念的变化,相关系数为0.436。DeepSeek-V3.1的准确性最低,在没有个人背景信息的情况下相关系数为0.362。添加个人背景信息并未一致地提升任何LLM的表现。
- 操控检测器与实际信念变化之间的相关性接近于零。只有Jaipersaud等人的研究实现了微弱但具有统计显著性的0.137相关系数。
但需注意:该研究测量的是用户在与GPT-4o进行单次对话后信念的变化。目前尚不清楚这种变化是否能在多次对话中持续累积。
为何重要:作者表明,早期检测操纵性LLM输出的方法不足以评估LLM的实际说服力。测试的LLM在仅基于与GPT-4o的对话(即不依赖用户人口统计信息、个性特征和价值观等数据)的情况下,对用户信念实际变化的估计表现尚可。这为开发既能防范操纵性LLM行为又能更好服务用户利益的系统指明了方向。
我们的思考:作者并未分析那些旨在服务用户利益的模型对话如何改变用户信念的案例。这种研究具有重要意义,因为其结果将直接影响AI在支持用户目标方面的应用,例如帮助用户学习技能、掌握知识体系或培养健康生活方式等场景。