Latent Space

[AINews] Midjourney Medical: scan your organs like you step on a scale

8.5内容质量
[AINews] Midjourney Medical: scan your organs like you step on a scale

TL;DR · AI 摘要

Midjourney 推出医疗成像设备 Scanner,使用超声波替代传统 CT/MRI,宣称分辨率可达 0.5 毫米。

核心要点

  • Midjourney Scanner 使用 358,000 个超声波元件,数据采集速率达 17 GB/s。
  • 当前系统为 Gen 1 原型,扫描一次需约 20 分钟,受限于带宽和算法。
  • Midjourney Spa 首个地点设于旧金山,占地约 25,000 平方英尺。

结构提纲

按章节快速跳转。

  1. Midjourney 宣布推出其第二款产品 Scanner,用于医疗成像。

  2. Scanner 使用 358,000 个超声波元件,数据采集速率达 17 GB/s。

  3. 当前系统为 Gen 1 原型,扫描一次需约 20 分钟,受限于带宽和算法。

  4. Midjourney Spa 首个地点设于旧金山,占地约 25,000 平方英尺。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Midjourney Scanner
    • 技术规格
      • 358,000 超声波元件
      • 17 GB/s 数据采集速率
    • 当前状态
      • Gen 1 原型
      • 扫描时间约 20 分钟
    • Midjourney Spa
      • 旧金山 Union Square
      • 25,000 平方英尺

金句 / Highlights

值得收藏与分享的关键句。

#Midjourney#医疗成像#超声波#AI 医疗
打开原文

[AINews] Midjourney Medical:像站在体重秤上一样扫描你的器官

AINews:工作日精选

仅靠自筹资金的前沿实验室宣布其第二款产品和第二项商业冒险。

2026年6月18日

今天Midjourney Medical的发布是否算作AINews,这确实是个艰难的选择。是的,Midjourney是全球最显著且独特的AI实验室之一。但正如David Holz迅速指出的那样,扫描仪或Spa中目前甚至没有直接使用AI。但确实,超声CT成像显然需要大量AI的辅助,并且像BioHub的CryoEMs对ESM所做的那样,解锁了大量新的下游应用。然而,正如Hacker News迅速指出的那样,这个扫描仪的实际准备程度和实用性仍存在许多未解的问题。

是的,那就是我在直播中的表现,我们正在转录直播内容,以节省你两个小时的时间。

总体氛围令人感到兴奋且鼓舞人心;我坐在Robert Scoble旁边,他曾亲历最初的iPhone和Tesla(以及Google Glass)发布会,他同意认为这次发布会的雄心壮志与之相当;还坐在Tanishq Abraham旁边,他恰好巧合地在推特上发布了这篇关于超声CT的《自然》论文:

Tanishq Mathew Abraham,博士

@iScienceLuvr

这篇论文非常有趣……使用超声成像生成腹部和大腿的整个活体人体横截面图像。基本上是尝试用超声实现类似CT/MRI的成像!超声成像被严重低估了 :)

2026年6月17日 下午10:33

·

8.12K次浏览

6条评论

9次转发

61个赞

接下来是你必须了解的事实。

事实 / 宣布

  • 该设备被描述为全身超声CT/全身超声系统。
  • David Holz将其描述为“50年来首个全新的全身医学成像方式”。
  • 扫描仪使用超声波,而不是MRI、X射线或CT辐射。
  • 该系统包括:每芯片/系统8,960个换能器 40个系统排列成环 总共358,000个超声元素 直径70厘米的环 波在水中以约1,481米/秒的速度传播 数据采集速度约为17GB/s 每个体层约40GB数据 使用21台服务器进行重建 声称计算能力达到2 PFLOPS 声称原始数据量达806TB 移动速度为4厘米/秒 目标是在60秒内完成数百层扫描 声称可分辨内部组织细节至约0.5毫米
  • 当前展示的图像包括:真实的体层图像 与MRI的对比,特别是大腿/肌肉边界图像 超声波幻影图像 器官和生物结构的分割图像
  • 当前系统为Gen 1 / 原型,而非最终的消费产品。
  • Midjourney表示,目前展示的图像尚未使用AI。
  • 参与设备开发的团队人数约为九人。
  • 目前已有大约十几人接受了扫描。
  • 当前扫描大约需要20分钟,因为系统仍受带宽、算法、DSP和原型数据传输基础设施的限制。
  • Midjourney还宣布了Midjourney Spa: 首个地点:旧金山联合广场附近 约25,000平方英尺 四层楼 高温浴缸、桑拿、冷水池、健身房和其他水疗设施 约9-10台扫描仪 已签署租赁合同并开始设计 由与Blue Lagoon等大型水疗项目相关的建筑师设计 目标开业时间:2027年底
  • Midjourney 表示公司是自筹资金,没有投资者,并且能够自行资助第一家水疗中心。
  • 该公司表示已经开始与 FDA 进行讨论。
  • 初始的监管/商业化路径可能围绕身体成分,因为这被认为更容易实现。
  • 更多的工作机会和信息将在 midjourney.com/medical 上公布。

预测 / 目标 / 对未来的声明

  • Midjourney 表示其长期目标是拥有 50,000 台扫描仪。
  • 声称的目标是:每月实现多达 10 亿次扫描,足以让每个人都能接受全身成像。
  • Holz 表示,不到十几台这样的机器,如果以全速运行,可能完成的全身扫描次数将超过全球所有 MRI 机器的总和。
  • 公司预计:2026 年底推出第二代扫描仪;随后推出搭载定制硅芯片的第三代扫描仪;未来系统将通过定制芯片、人工智能、物理模拟和更先进的计算基础设施变得更加先进。
  • Holz 预测扫描仪最终可能支持以下功能:频繁的个人健康追踪;每日/每周/每月的身体扫描;预防性医学;检测身体中的“异常”变化;身体成分跟踪;面向医生的复查;人工智能辅助的初步分析;可能实现数千种诊断;最终,一些治疗用途。
  • 他推测,预防性成像可能显著降低医疗成本,因为可以更早发现疾病。
  • 他表示,扫描仪的单次扫描成本可能比 MRI 便宜数百甚至数千倍,因为机器本身更便宜且更快。
  • 他表示,单次扫描的边际成本可能实际上接近于零,尽管实际商业模式将涉及水疗中心/设施经济。
  • 提到的可能定价模式包括:水疗会员制;随到随扫;仅扫描收费;仅水疗收费;一些更广泛的定价矩阵。
  • 第一家水疗中心被设计为一个学习实验室,用于研究使用模式:人们是否想要完整的水疗+扫描?健身房+扫描?快速扫描后离开?每日、每周、每月或每年扫描?
  • Holz 估计,扩展到数千家水疗中心可能需要约 200 亿美元的前期资本支出。
  • 他推测这些设施可能很快就能收回成本,甚至提到可能只需要六个月,但明确指出存在不确定性。
  • 治疗用途被描述为长期目标,而非短期内实现:肌腱/肌肉修复;聚焦超声;可能的无创手术;可能的远程癌症组织破坏,但明确表示这并非短期目标。

观点 / 愿景 / 定位

  • Holz 将 Midjourney 定位为一个由社区支持的研究实验室,而非一家典型的由风险投资支持的初创公司。
  • 他反复强调,Midjourney 的图像生成收入为其提供了自由,可以资助雄心勃勃的研发项目。
  • 扫描仪被描述为一项更广泛使命的一部分,即围绕积极的人类未来,而不仅仅是创造工具。
  • 他描述了理想体验为:“像 MRI 一样强大”、“像去一次水疗一样随意”。
  • 他不希望扫描过程让人感觉像在医生办公室。
  • 他希望水疗中心即使没有扫描仪也具有吸引力。
  • 他个人希望频繁获得健康反馈,使日常的饮食和锻炼选择变得可量化。
  • 他将扫描仪视为人工智能驱动医疗保健的潜在新支柱:人工智能需要快速、丰富、廉价的身体数据。
  • 他主张未来的重点不仅是人工智能模型,还包括新的基础设施,使人工智能能够对物理身体进行推理。
  • 他认为超声波是合适的成像方式,因为它可以快速、安全、密集且数据丰富。
  • 他对纵向、高频、亚毫米级的差异跟踪特别兴奋:不仅仅是“一次扫描”,而是随时间变化的过程。
  • 他将这一点定位为“MRI的第1天”:全身超声CT的早期图像可能看起来粗糙,但这种技术可能会有显著的提升。

原因 / 理由

  • 为什么选择超声而不是MRI?MRI很难同时做到快速和高质量。MRI扫描体验不佳:有管子、时间长、声音大。超声可以更安全地穿透身体传输更多能量。超声没有电离辐射。超声可以频繁重复使用。超声在医学上已经广泛应用,这使得一些监管路径更容易。
  • 为什么使用水浸?声波在水中传播得比在空气中更快、更有效。水耦合使得全身超声波传播成为可能。设计要求用户必须变湿,因此采用了水疗概念。
  • 为什么采用垂直上下扫描仪设计?优化了吞吐量。相比让用户躺进和爬出浴缸更容易。“上下”扫描支持更快的重复使用。
  • 为什么先建造水疗设备?为了学习实际操作。为了测试吞吐量。为了了解用户行为和使用扫描的意愿。为了优化定价和商业模式。为了收集数据。为了在大规模扩展之前创建一个可复制的模板。
  • 为什么Midjourney可以尝试这个?现有的图像业务已经产生收入。没有投资者意味着更少的限制。Midjourney已经拥有计算基础设施。公司具备人工智能、成像、传感器、可视化和系统工程方面的技能。Holz之前有来自Leap Motion的硬件经验。
  • 为什么不立即作为纯医疗设备推出?FDA/监管路径复杂。某些使用场景比其他场景更容易。身体成分分析是一个更容易的切入点。诊断和治疗性声明需要分阶段批准。
  • 为什么使用云处理?原始扫描仪数据量非常庞大。现场计算可以处理流媒体和压缩。Midjourney的大规模服务器集群可以处理繁重的重建任务。他们预计会使用安全/私有云工作流程。

批评 / 风险 / 开放问题

  • 监管的不确定性 Holz反复避免做出具体的FDA声明。他表示身体成分分析处于良好的路径上,但诊断尚未获得批准。从身体成分到“数千种诊断”的路径极其不确定。保险账单、CPT代码、临床采用和FDA分类仍然是开放的问题。
  • 医疗有效性尚未得到证明 转录内容展示了令人印象深刻的工程声明,但没有临床验证。没有提供敏感性/特异性数据。没有展示疾病检测的基准。转录内容中没有提到任何同行评审的证据。“可以看到奇怪的东西”目前还不能等同于具有临床行动价值的诊断。
  • 与MRI的比较部分存在苹果对橘子的情况 超声和MRI测量的是不同的物理属性。Holz承认MRI在某些方面仍然更好。目前的超声图像尚未普遍优于MRI。大腿的比较可能展示了USCT优于MRI的区域,但明确描述为“公平且不公平”。
  • 成本声明具有推测性 “几乎为零”的边际扫描成本排除了设施、人员、监管、放射科医生/医生审查、责任、清洁、会员运营和房地产成本。六个月的回报期明确是推测性的。2000亿美元的资本支出以扩大规模是一个巨大的融资和执行挑战。
  • 吞吐量的声明取决于未来系统。目前的扫描大约需要20分钟。60秒/高吞吐量的目标依赖于带宽、算法、DSP和硬件的改进。Gen 1是原型级别,而非工业级别。
  • 数据/隐私问题。扫描会产生非常敏感的全身健康数据。数据在压缩后可能会传输到Midjourney的云集群。Holz表示数据会是安全且私密的,但没有提供具体细节。健康数据治理、同意、存储、访问、删除以及医疗责任等问题并未深入探讨。
  • 假阳性/过度诊断。频繁的全身扫描可能会识别出许多模棱两可的异常。这可能会引发焦虑、不必要的后续检查、偶然发现的病变以及后续成本。Holz承认“标记奇怪的事物”并非轻率之举,可能会带来负面影响。
  • 临床流程仍然不明确。谁来阅读扫描结果?用户会得到什么反馈?哪些信息会发送给医生?哪些内容在法律上被视为诊断与健康/身体成分?紧急发现如何处理?
  • 医疗与水疗的混合模式带来了运营复杂性。医疗设备+湿式水疗+高吞吐量的消费者设施是一种奇怪的组合。清洁、感染控制、可及性、隐私、应急协议、人员配备和医疗监督都是非同寻常的挑战。
  • 治疗手段还远未成熟。聚焦超声手术/癌症破坏被提及为技术上可行,但并非短期内可实现。Holz明确表示,成像属于低垂的果实,而治疗手段则令人感到恐惧且监管繁重。
  • 品牌一致性风险。Midjourney以图像生成而闻名;扫描仪/水疗/医疗基础设施是一个重大的类别跳跃。Holz承认,随着公司宣布更多项目,未来六个月可能会让公司显得“令人困惑”。

那又如何

  • 短期现实:Midjourney已经构建了一个真正的全身超声CT扫描仪原型,并正在开设一家类似水疗的旧金山设施作为首次部署/测试平台。
  • 中期押注:频繁、廉价、愉悦的全身成像将成为一种新的消费者健康行为。
  • 长期愿景:Midjourney希望构建全球医疗影像基础设施,可能使全身扫描成为常规并可由AI分析。
  • 主要质疑:工程演示令人兴奋,但临床/监管/经济案例仍大多未经验证。“酷炫的全身图像”与“安全、可报销、具有诊断功能的医疗产品”之间的差距才是关键所在。

2026年6月16日至6月17日的AI新闻。我们检查了12个子Reddit、544个Twitter,没有进一步的Discord。AINews的网站允许您搜索所有过往的期数。请记住,AINews现在是Latent Space的一部分。您可以选择加入或退出电子邮件频率!

AI Twitter回顾

头条新闻:Midjourney医疗

发生了什么

Midjourney推出了一套医学成像/扫描系统,并随后发布了关于该系统的技术分析,引发了人们对AI实验室进入硬件/医疗设备领域的兴趣、质疑以及更广泛的讨论。

  • Midjourney的官方账户在其主要公告推文上发布了“深入探讨我们的新‘Midjourney Scanner’的技术细节”,这似乎是该项目的核心发布资料 @midjourney 。
  • 在发布之前或同时,有关扫描仪的讨论已经展开,其权衡被总结为:无辐射、无磁性、快速、低成本,但需要用户坐在一个水浸式水箱中,目前的分辨率比CT/MRI要粗糙 @iScienceLuvr 。
  • 似乎有一个演示是现场进行的:一位与会者表示,“今晚我把手放在 @midjourney 的演示扫描仪中”,将其描述为一个有形的原型,而不是纯粹的概念性公告 @saranormous 。
  • 这一公告引发了支持者的强烈热情,他们认为这是 Midjourney 非常雄心勃勃的产品方向的证据,其中包括诸如“这太棒了”和“让像 @DavidSHolz 这样的发明家去发明”的评论 @saranormous 。
  • 也有人将此次发布视为对更渐进式的人工智能硬件努力的竞争;有评论将其与“无聊的领带相机”策略进行对比,并认为如果 Midjourney 正在开发这种设备,其他人工智能实验室应该“打自己” @matvelloso 。
  • 还有一些对成像方法感兴趣的人发表了轻量级的技术评论,包括对探测器/发射器布置和实时变体的猜测 @johnowhitaker ,此外还有评论暗示一些用户似乎对发布主题异常准备充分 @johnowhitaker 。

事实与观点

推文中明确提出的事实性声明

  • Midjourney 发布了一篇关于名为“Midjourney Scanner”的产品的技术分析 @midjourney 。
  • 该扫描仪被描述为:无辐射、无磁性、快速、低成本、需要水浸槽、分辨率比 CT/MRI 粗 @iScienceLuvr 。
  • 有人亲自尝试了演示扫描仪,用手进行体验 @saranormous 。

解释/观点/推测

  • 强烈的正面反应将扫描仪描述为具有远见或“未来”的设备 @saranormous 。
  • 一些观察者认为此次发布表明 Midjourney 正在追求比竞争对手人工智能实验室更雄心勃勃的硬件路线图 @matvelloso 。
  • 一个幽默的回复将这一想法升级为“接下来 Midjourney 将负责全货运输”,显然这不是一个事实性声明 @yacinelearning 。
  • 独立的技术评论提出了可能的未来设计方向,例如分布式分散的探测器和发射器或实时系统,但这些并未被描述为 Midjourney 当前扫描仪的功能 @johnowhitaker 。

技术细节和推断的模态

推文语料库中只包含有限的硬性规格,但它们足以概述该项目的定位。

  • 无电离辐射:“无辐射”意味着系统没有使用 X 射线/CT 风格的电离模态 @iScienceLuvr 。
  • 无磁铁:“无磁性”将其与依赖强磁场的 MRI 区分开来 @iScienceLuvr 。
  • 水浸槽:这是关于物理传感设置的一个重要线索。水耦合在一些声学和波传播成像系统中很常见,因为它可以改善发射器、组织和探测器之间的传输和耦合 @iScienceLuvr 。
  • 分辨率低于 CT/MRI:在这些推文中,系统并未声称在分辨率上超越现有的临床成像;事实上,明确的限制是分辨率比 CT/MRI 粗 @iScienceLuvr 。
  • 速度/成本定位:它被描述为快速且低成本,这表明其价值主张可能在于可访问性、吞吐量或便携性,而不是高端图像保真度 @iScienceLuvr 。

还有一些技术性很强的反应,对可能的传感挑战进行了评论:

  • John Whitaker 指出,基于光、超声波、电流等的系统比 X 射线在逆问题上更复杂,因为信号不会像 X 射线那样沿直线传播,使得图像重建更加复杂 @johnowhitaker 。
  • 他还建议未来版本可以采用大量分散的探测器和发射器,而不是使用机械移动部件,这表明至少一些读者推测当前系统可能涉及运动/扫描几何结构,而不是完全并行化的捕捉方式 @johnowhitaker 。

综合来看,公众讨论指向一种非 CT、非 MRI 的模态,其基于波的重建方法,并包含有意义的算法和逆问题内容,尽管这些推文并未提供明确的模态标签或性能表,除了已提到的权衡之外。

不同的观点

支持 / 乐观

  • 最热情的一派认为,这正是 AI 创始人应该追求的高回报、非主流、非共识发明,而不仅仅是渐进式的聊天机器人/UI 产品。这种语气在 “让像 @DavidSHolz 这样的发明者去发明” 中表达得非常清楚 @saranormous 。
  • 现场演示的反应强调了与真实扫描仪互动的直观新颖性,而不仅仅是阅读论文或观看视频 @saranormous 。
  • 一些人将此举解读为 Midjourney 可能正在超越图像生成,朝向全栈应用发明迈进,可能结合硬件、传感和 AI 重建。

中立 / 技术好奇

  • 在这些反应中,最务实的反应是简洁的优缺点总结:无辐射、无磁场、速度快、成本低,但需要水浸和分辨率低于 CT/MRI @iScienceLuvr 。
  • 技术好奇的观察者喜欢这种模态的奇特之处,同时立即识别出其物理和系统上的权衡:与 X 射线相比,信号传播不沿直线;需要更好的实时捕捉安排;探测器/发射器拓扑结构的问题 @johnowhitaker 。

反对 / 怀疑 / 谨慎

在这个推文集合中,直接的敌对批评有限,但怀疑态度在几个点上是隐含的:

  • 对临床实用性的怀疑:指出其分辨率比 CT/MRI 粗略是一个实质性的限制,尤其是在医学领域,图像质量可能直接影响诊断价值 @iScienceLuvr 。
  • 对实用性的怀疑:需要水浸槽是日常临床或消费者使用中严重的可用性和部署限制 @iScienceLuvr 。
  • 对模态的怀疑:关于非直线传播的技术评论暗示了替代成像系统通常面临的挑战:物理和逆向重建难度大,漂亮的演示可能不会自动转化为稳健、临床上可靠的成像 @johnowhitaker 。

竞争视角

  • 一个值得注意的观点更关注扫描仪本身所传达的战略意义,而不是扫描仪本身:如果 Midjourney 正在尝试硬件-医疗发明,那么专注于更狭窄的可穿戴摄像头概念的人工智能公司相比之下显得保守 @matvelloso 。

背景:为什么这很重要

Midjourney 主要以图像生成公司而闻名。因此,其医疗/扫描仪的披露之所以值得关注,有以下几个原因:

  • 这表明其愿意从生成媒体软件转向现实世界的感知和硬件。
  • 医学影像是一个领域,其中反问题、信号处理、重建和越来越多基于机器学习的解释都至关重要;它并不是一个显而易见的邻近领域,但技术深度却非常显著。
  • 扫描仪似乎并不是被定位为“在所有指标上都优于MRI/CT”,而是作为经典颠覆路径中的一个潜在进入者:在某个高端指标上表现较差,但在成本/可及性/操作负担方面表现更好。
  • 如果该系统确实快速且低成本,最可能的含义是:用于筛查或分诊,在CT/MRI可及性有限的场景中,或者在需要避免辐射的重复成像中,以及在某些特定解剖学使用场景中,沉浸式设置是可以接受的。

此次发布也符合2025年更广泛的趋势,即越来越多与AI相关的公司试图定义自己不仅仅是模型供应商,而是构建通往物理世界的新接口。在这种框架下,Midjourney Medical的关注点不在于单一扫描仪,而在于前沿AI时代初创公司是否能够将复杂的感知系统产品化,而不仅仅是生成内容。

意义与开放问题

  • 监管路径:这些推文没有涉及任何批准、验证研究,或该系统是仅用于研究还是用于临床部署。对于医学相关性,这些问题至关重要。
  • 重建堆栈:“技术深入”一词暗示公司讨论了内部细节,但此处的推文并未暴露实际的算法细节。关键问题可能是在受限感知设置下重建质量的表现。
  • 用例特定性:分辨率低于CT/MRI并不一定意味着该系统注定失败;许多成像工具通过在特定工作流程中表现良好而取得成功。但这些推文中并未提及任何具体的适应症。
  • 形状因子挑战:水浸式水箱在某些扫描场景中是可以接受的,但在其他场景中则是一个重大障碍。这是否是原型的缺陷,还是根本性的需求,这非常重要。
  • 通量和成本现实性:“快速”和“低成本”只有相对于基准才有意义——扫描时间、硬件成本、消耗品、操作员负担以及后续解释的开销。这些数据在这些推文中并未提供。
  • AI的作用:最有趣的技朮问题可能是Midjourney的贡献主要在于硬件设计、反问题重建、学习去噪/超分辨率、自动化解释,还是涵盖所有这些的集成堆栈。社会反应表明,人们因为Midjourney的品牌与学习视觉系统相关,而不是传统医疗设备,所以对该项目有大量预期。

AI研究、代理和开放模型

  • 一个值得注意的研究元观点:过去一年中,中国开源文献被强调为异常高回报的跟踪对象,声称“alpha(超额收益)巨大” @himanshustwts 。
  • PapersWithCode的热门趋势论文是VibeThinker-3B,被描述为一个30亿参数模型,探索小型语言模型中的可验证推理,并据称达到了DeepSeek V3.2、GLM-5和Gemini 3 Pro的性能水平 @NielsRogge 。
  • 一篇关于计算机使用的论文PreAct因其将成功代理运行编译为一个受保护的可重播状态机而受到称赞,消除了重复运行时的每一步语言模型调用,使重播速度提高了8.5倍至13倍 @dair_ai 。
  • 另一篇关于强化学习/智能体的论文提出了 LLM-as-Environment-Engineer 的概念,其中策略利用自身的失败来重新设计下一个训练环境;相关的基准是 MAPF-FrozenLake @dair_ai 。
  • Omar Sar0 认为编码智能体需要验证器和稳健的防护机制,而不是盲目自主循环,这强化了向受约束智能体执行发展的趋势 @omarsar0 。
  • David Khourshid 对编码智能体的看法更偏向于操作层面:AI 生成的代码仍然需要被阅读,不阅读它只会将调试负担推迟而已 @DavidKPiano 。
  • 在强化学习理论方面,John Schulman 表示 PPO 在大语言模型时代重新崛起的原因是原始论文中未预料到的一些因素,包括重要性比目标函数通过纠正数值误差、异步训练和前向传播噪声带来的偏差,而裁剪则通过后来才被理解的机制改变了熵;他引用了 DAPO @johnschulman2 。
  • 相关地,Chris Wolfe 表示最近的 GRPO 后分析论文(例如 DAPO、Dr. GRPO、GSPO、TIS)正是他希望在推理/智能体场景中看到的 PPO 目标分析工作 @cwolferesearch 。
  • John Carmack 发布了对用于视觉表示学习的时序差分方法的详细批评,总结该方法:训练一个帧编码器和一个“运动编码器”,基于 RGB 帧差异,使得 latent(frame1) + delta ≈ latent(frame2),并使用 0.25 秒的步长;他质疑了 DINO EMA 抗崩溃选择以及 delta 构造的合理性 @ID_AA_Carmack 。

AI 基础设施、推理和产品发布

  • Xenova 发布了现已关闭的 Fable 5 项目的演示和内核,声称其将 Gemma 4 的速度提升到了 WebGPU 上的每秒 255 个 token;其观点是智能体内核优化可以显著提升浏览器/设备端的推理性能 @xenovacom 。
  • Fal 宣布了 Kling 3.0 Turbo 和 O3 升级:生成速度更快、成本更低、唇形同步更佳、运动更稳定、提示/参考一致性更强的“Omni”模式,支持长达 15 秒的视频片段、Omni 支持全 4K 生成,并改进了故事板和多镜头工作流程 @fal 。
  • Kling 自己的账号放大了 Fal 的发布,称其为面向创作者的品质和速度提升 @Kling_ai 。
  • GitHub Copilot 的 Auto 模式现在使用自定义路由模型,根据推理深度、代码复杂性、调试难度和工具编排需求来选择模型;一篇博客文章和一篇相关研究论文被分享 @pierceboggan ,@pierceboggan 。
  • 据简短的生态系统说明,Kimi Code Web 看起来已经恢复在线 @bigeagle_xd 。
  • Grok 图像生成项目通过 grok.com/imagine 被提及,但没有实质性的技术细节 @chaitu 。

人才、实验室和竞争动态

  • 除了 Midjourney 之外,最大的人员变动是 Noam Shazeer 宣布他将加入 OpenAI,离开 Google,并表示这是一个艰难的决定,同时赞扬了他之前的团队 @NoamShazeer 。
  • Sam Altman 对此表示欢迎,称 Noam 是自 OpenAI 成立以来他最想合作的人之一 @sama ,然后开玩笑说 OpenAI 在“noams”方面是 SOTA @sama 。
  • 评论强调了 Shazeer 作为 Transformer、T5 和 Switch Transformer 的合著者以及稀疏 MoE 系统先驱的重要性,一些人称这是今年最重要的 AI 人才变动 @scaling01 。
  • Aidan Clark 表示对与 Noam 合作感到兴奋,并将其与 RSI 正在接近的感觉联系起来 @ aidan_clark 。
  • 从回复中可以更广泛地看到行业观点:DeepMind/Brain 合并可能间接使 Anthropic/OpenAI 受益 @ arohan。Anthropic 获得了 Karpathy,而 OpenAI 获得了 Noam @TheTuringPost。有推测认为,这一举动更多地反映了 Google 的失望,而不是 OpenAI 的撤出 @teortaxesTex。
  • 还有关于相对权力和估值的讨论:Liam Fedus 发布了“消息:OpenAI 的估值已超过 Anthropic”的帖子 @LiamFedus。
  • 更加带有观点的国际政治和竞争分析认为,各方都有动机防止 Anthropic 保持过大的领先优势,但这些内容显然是推测性的,而非事实报道 @teortaxesTex,@teortaxesTex。

采用、使用和模型质量讨论

  • Blanche Minerva 提出了一条实用的质量投诉:ChatGPT 和 Claude 可能在像两篇论文引用重叠这样具体的问题上产生分歧,这突显了在应用知识任务中持续存在的可靠性问题 @BlancheMinerva。
  • 几个帖子聚焦于 GLM 和中文模型的进展:对 GLM 团队的赞誉是“英雄般的” @teortaxesTex,后续提到最新一代模型达到了类似 Opus 级别的预期,超越了之前的假设 @teortaxesTex,推测未来前沿能力的提升可能更多依赖于强化学习的配方,而不是单纯的预训练规模 @teortaxesTex,@teortaxesTex。
  • 还有一组高度推测性的帖子,讨论了“Claude”身份/角色在输出中出现的显著性,将其描述为一种模因或隐写行为,而不是已确立的事实 @teortaxesTex,@teortaxesTex,@teortaxesTex。

更广泛的科技与社会

  • Tacit Labs 的加入公告将生物学描述为 AI 应该发现真正新知识的下一个领域,而不是仅仅重新组合现有理解 @maxisawesome538。
  • 有关白宫要求解决停机问题的笑话,提醒人们 AI 政策讨论仍然经常将深奥的计算机科学不可能性压缩成听起来简单的请求 @the_engi_nerd。
  • 在自主性方面,有一篇帖子指出,尽管 Waymo/Tesla 使该类别看起来越来越可行,但似乎缺乏新的自动驾驶初创活动 @gabriberton。
  • 关于学习、编码和贡献的杂项观点帖子包括:你可以在没有深厚的数学背景的情况下为 AI 做贡献 @gabriberton,一个关于模型是否能理解它无法生成的标记的标记理解/生成面试问题 @gabriberton,一个关于可以用“半天的氛围编码”构建 Slack 替代品的笑话 @gabriberton。

AI Reddit 总结

/r/LocalLlama + /r/localLLM 总结

1. GLM-5.2 开源权重前沿基准测试

  • GLM-5.2 是首个在 Terminal-Bench 上得分超过 80% 的开源权重模型,并且在所有其他开源模型中表现最佳(活动:1569):该图是一张技术基准条形图,用于展示 Terminal-Bench 2.1 的表现,GLM-5.2 得分为 81.0,使其成为图表中首个突破虚线 80% 阈值的开源权重模型,尽管闭源模型 Claude Opus 4.8(85.0)和 GPT-5.5(84.0)总体上仍领先(图片)。该文章将此描述为 GLM-5.2 击败了其他开源模型,甚至包括 Gemini 3.1 Pro,但有评论者指出 Terminal-Bench 2.1 是 Terminal-Bench 2 的一个“更简单”的版本,其超时时间和规则有所放宽,因此跨版本的得分比较可能会被夸大。评论区就“开源权重”是否真正意味着“本地”可用性展开了讨论:一位用户认为“如果可以下载,它就是一个本地模型”,而另一位用户则指出,由于硬件要求,99% 的用户仍然无法在本地运行该模型。有评论者认为 Terminal-Bench 2.1 与 Terminal-Bench 2 并不直接可比,声称 2.1 是一个更简单的版本,其超时时间已更改、问题规则放宽,并且与更广泛的测试框架兼容性更好。他们指出,模型在 2.1 上的得分通常不应低于在 2 上的得分,并建议更有意义的信号将是实验室开始针对基准进行优化之前的初始 Terminal-Bench 3 得分。围绕 GLM-5.2 是否应被视为“本地模型”展开了一场技术部署上的讨论。一方认为“如果可以下载,它就是一个本地模型”,因为与 Claude 或 ChatGPT 不同,用户可以运行该模型的权重,而另一方则指出,由于硬件/性能限制,例如消费级系统上每秒的令牌数非常低,对于 99% 的用户来说,该模型实际上几乎无法在本地运行。

使用 7 天免费试用继续阅读

订阅 Latent.Space 以继续阅读本文,并获得 7 天免费访问完整文章存档的权限。

开始试用

已经是付费订阅者?

上一篇

下一篇