Latent Space

[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model

8.5内容质量
[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model

TL;DR · AI 摘要

Black Forest Labs发布FLUX 3多模态模型,在视频生成和机器人控制领域超越现有主流模型,开放权重版本即将推出。

核心要点

  • FLUX 3支持文本/图像/视频到视频的生成及多语言对话,覆盖10种视觉风格
  • FLUX-mimic模型已实现机器人动作控制,mimicrobotics为首批合作伙伴
  • 开发版模型将开放权重,可能引发行业技术选型变化

结构提纲

按章节快速跳转。

  1. §FLUX 3模型发布

    介绍Black Forest Labs最新发布的多模态模型FLUX 3的核心功能与技术优势

  2. 详细列举文本到视频、图像到视频等9种生成能力及多语言支持特性

  3. Seedance 2.0Gemini Omni等模型的性能对比及创新点说明

  4. FLUX-mimic模型实现视频动作到机器人控制的映射,mimicrobotics验证案例

  5. 开放权重的开发版本即将发布,可能改变行业技术生态格局

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • FLUX 3模型
    • 核心功能
      • 多模态生成
      • 视频动作控制
      • 开放权重计划
    • 技术优势
      • 超越Seedance 2.0
      • 支持机器人控制
      • 多语言对话能力
    • 应用领域
      • 影视制作
      • 机器人工程
      • 虚拟助手

金句 / Highlights

值得收藏与分享的关键句。

  • FLUX 3 Video已实现从文本到视频、图像到视频等9种生成模式,支持多语言对话和10种视觉风格

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • FLUX-mimic模型证明FLUX 3已具备驱动机器人能力,mimicrobotics为首批验证合作伙伴

    第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 开发版模型将开放权重,可能引发与Stability AI、Runway等公司的技术竞争

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI模型#多模态#机器人#Black Forest Labs
打开原文

[AINews] Black Forest Labs FLUX 3 - 超越Seedance 2.0、Gemini Omni和Grok Imagine的多模态流模型,以及FLUX-mimic视频-动作机器人模型

AINews: 工作日精选

BFL的重大突破!

2026年7月24日

周四通常是人工智能领域产品发布最密集的一天。尽管OpenAI在推出新消费级ChatGPT语音和企业级OpenAI Presence产品时,其曝光度超过了Claude Voice(这完全是时间巧合,我们确信),但这些成就与BFL今天发布的FLUX 3视频模型相比,显得黯然失色:

Black Forest Labs

@bfl_ai

重磅推出FLUX 3。一个集图像、视频、音频和动作预测于一体的多模态模型。FLUX 3视频在各种风格中都能生成更贴近现实的创作。FLUX 3视频现已开放早期访问(链接见下文)。通过统一架构联合训练,我们的模型可扩展至

2026年7月23日 下午3:08

·

576K次浏览

238条评论

676次转发

4.72K次点赞

我们之前在广受好评的Anjney Midha播客中曾报道过BFL:

#### 输出最大化教授——Anjney Midha,AMP

2024年6月18日

立即收听

大多数GenMedia成员都还记得BFL在2024年首次推出Flux 1时的首页设计,当时就暗示了未来将推出视频模型,其标志位于森林中。两年后,这一愿景终于成为现实:

这篇博文介绍了Self Flow,涵盖了所有模态并提出了强有力的偏好主张:

“其核心功能包括以下内容(所有输出均包含原生音频生成):

  • 文本到视频生成。
  • 从起始帧(“动画”)延续或使用图像作为视觉参考的图像到视频生成。
  • 通过参考片段生成视频,将源视频的核心元素(例如相同角色)带入新场景或上下文中。
  • 从输入视频和音频生成视频-音频延续。
  • 关键帧到视频生成,用于在定义的时刻之间进行可控过渡。
  • 多语言对话。
  • 广泛的视觉风格和宽高比选择,远超传统电影输出范围。
  • 将单个片段智能串联成长片段、多镜头序列。
  • 极高的风格多样性——FLUX 3视频轻松应对从手持摄像机拍摄的纪实风格到动画和电影的多种风格。
  • 强大的字体生成和动画设计能力。”

上述部分功能属于其他前沿实验室模型的SOTA特性,如我们在Grok Imagine播客中讨论的那样。因此,社区已经明确知晓:现在已有独立开发的、可能达到SOTA水平的模型复现了这些能力,且开源权重的开发版本即将发布。

为什么视频代理模型是下一步——Ethan He,xAI Grok Imagine

2026年6月1日

我们本周将公布AIEWF演讲者!请参与AI工程调查!

除了上述发布,团队还宣布了FLUX3-mimic,这证明FLUX 3模型正在学习足够强大的世界模型,能够驱动机器人...

进展:FLUX 3的早期版本现已在机器人上运行。

@mimicrobotics

是首批获得FLUX 3早期访问权限的合作伙伴之一。我们共同开发了FLUX-mimic,这是一个结合FLUX 3主干网络与mimic在灵巧机器人学习领域专长的视频-动作模型

14.5K次浏览

2条评论

7次转发

138次点赞

...并预测其在真实工厂环境中的影响...

2026年7月22日至7月23日AI新闻。我们检查了12个Reddit子版块、544个Twitter账号,未发现Discord相关内容。AINews官网支持搜索所有历史文章。提醒您,AINews现已整合至Latent Space板块,您可随时调整邮件接收频率!

AI Twitter回顾

开源代码、开源模型与蒸馏技术的政策分歧

  • Stack v3 是当天最重要的开源数据发布:@anton_lozhkov 宣布推出 Stack v3,目前成为公开发布的最大开源代码数据集:114TB原始数据、2.24亿个仓库、440亿个文件、770种语言,约5万亿个去重/过滤后的标记。相比v2版本,过滤语料库从约5500亿个标记跃升至5万亿个标记,C++(15倍)、TypeScript(7.5倍)、Rust(7倍)和Python(4.8倍)等语言增幅尤为显著。运营层面的重要变化包括:v3版本直接内嵌内容而非使用Software Heritage ID、包含截至2025年8月的GitHub重新爬取数据、排除限制性许可代码,并提供即用型训练数据集和完整桶用于自定义去重/过滤。Hugging Face研究人员明确将其定位为下一代开源代码模型和网络防御工具的基础设施:参见 @LoubnaBenAllal1、@lvwerra 以及 @eliebakouch 对先前Stack版本被用于许多公开代码模型训练混合的评论。
  • 蒸馏技术仍是当前最活跃的意识形态分歧点:多个高价值推文反对将"互联网规模预训练"与输出层蒸馏技术进行尖锐区分。@GergelyOrosz 将通过提示进行模型检查类比为反向工程竞争对手产品,而 @SchmidhuberAI 强调蒸馏技术有着悠久的历史。@Suhail 认为实际应对方式不是禁止,而是加大对开源权重本土模型的投资,@garrytan 的表述更简洁:开源权重具有战略重要性。这些推文的潜台词是,像 Stack v3 这样的开源数据集显著提升了所有希望构建竞争性代码模型而不依赖封闭生态系统的实验室的基准线。

多模态前沿:FLUX 3、机器人迁移与新型音频/TTS系统

  • Black Forest Labs 的 FLUX 3 将多模态前沿扩展至图像/视频之外:@bfl_ai 发布 FLUX 3,这是一个覆盖图像、视频、音频和动作预测的统一多模态模型,提供 FLUX 3 Video 的早期访问权限,并明确声称相同架构可扩展至机器人领域。团队成员将其与早期的 Self-Flow 研究联系起来,包括 @hila_chefer 和 @robrombach。技术层面的关键在于统一的训练方案:不是松散的专用生成器家族,而是旨在弥合媒体生成与控制的单一架构。
  • mimic 的 FLUX-mimic 是该理论的具体机器人实现:@mimicrobotics 将 FLUX-mimic 描述为基于 FLUX 3 的视频-动作模型,使用机器人和可穿戴设备数据进行训练,支持单台本地GPU部署,具备通用灵巧性。他们的核心主张是更高质量的视频世界建模可直接提升机器人控制精度和样本效率,目前已与奥迪进行测试。这与 @GeneralistAI 的观点相呼应,其GEN-1系统现在支持多种末端执行器,并能在"手部"中途变化时进行自适应调整,进一步印证了通过形态条件而非专用机械臂来实现通用身体策略的可能性。
  • 音频领域在技术栈两端均有重大进展:@Alibaba_Qwen 在 Flash 和 Plus 版本中推出了支持 16 种语言的 Qwen-Audio-3.0-TTS,具备 [whisper]/[angry] 等内联控制标签、自然语言风格引导、噪声参考鲁棒性,以及最长 3 分钟的一次性生成能力,并在 Artificial Analysis TTS 领域榜单上排名第一。另一方面,@HuggingApps 推出 WordVoice TTS,这是一个体积更小的模型,可对每个单词的时长、音量、音高和语调进行精细控制,其价值更多体现在音频工具控制界面的实验性探索,而非单纯追求榜单排名。

代理基础设施:工具链、动态工作流、程序化记忆与基准测试

  • 技术重心正在从提示工程转向工具链建设:多篇推文都指向相同的工程理念。@unclebobmartin 描述了一种“极端约束”工作流,其中信任来源于测试、QA、变异测试和指标,而非人工代码审查。@ThePrimeagen 表示他对 AI 编程工作流的态度显著改善,尤其是在大规模结构重构方面。@TheTuringPost 指出系统简洁性的重要性:“图工程”本质上是旧软件架构的重新命名,大多数代理系统除非需要分支、验证或人工审批,否则并不需要复杂的图结构。
  • 多个具体的工具链/编排框架发布引起关注:@omarsar0 总结了《Harness Handbook》论文,该论文通过将运行时行为映射到源码位置,提升了代码代理的规划成功率并减少了规划器的 token 使用量。同一位作者还描述了动态工作流,这是一种对循环/图/路由模式的通用抽象,可支持模型委员会、顾问-法官-执行者架构,以及跨 Claude/Codex/Hermes 等多后端编排。@witcheer 发布了 Hermes Profiles,通过命名空间隔离实现了独立内存、API 密钥、会话、网关和导出/导入路径的代理实例,属于实用的代理生命周期基础设施而非模型创新。@davidfowl 同时宣布了微软 VS Code 代理应用的新底层协议。
  • OpenAI 的实际发布重点在于产品/用户体验,而非 GPT-6:在围绕“Opus 5”和 @kimmonismus、@theo 等账号推测更大模型发布的背景下,OpenAI 推出的更新更偏向渐进式改进,但仍对代理工作流程具有重要意义。@OpenAI 在桌面应用中为 Plus/Pro/Business/Edu/Enterprise 用户推出了 ChatGPT Voice 功能,该功能由 GPT-Live 驱动,支持控制计算机并在 ChatGPT Work 和 Codex 之间协调工作。@OpenAIDevs 新增了多文件夹 Codex 项目功能,随后又推出了已发布网站的站点分析功能。用户反馈褒贬不一:一些人认为语音驱动的多线程协调是真正的用户体验变革([@reach_vb, @whoiskatrin]),而另一些人则认为内部炒作暗示了更大的功能([@kimmonismus])。
  • ChatGPT 中的“健康”功能的战略重要性可能被低估:@OpenAI、@ChatGPTapp 和 @thekaransinghal 宣布在美国推出 ChatGPT 健康功能,允许用户连接 Apple Health 和支持的医疗记录。该功能的重要实现声明包括:连接的健康数据会获得额外加密,不会用于训练基础模型或投放广告,且该功能建立在大量医生审核工作的基础上。这与其说是新模型的发布,不如说是在现有模型能力之上构建了一个新的高信任度应用层。
  • Hugging Face 被黑事件继续主导安全讨论:@johnschulman2 呼吁公开对话记录,以判断顶级代理是否明知故犯地发起攻击,还是价值偏移通过子代理产生。@RyanGreenblatt、@jachiam0 和 @Thom_Wolf 推动更广泛的教训总结:内部 AI 代理安全与标准外部威胁模型存在差异;具备进攻性网络能力的模型可能特别容易受到对抗性逆向工程攻击;讽刺的是,首个公开的自主攻击叙事中,闭源模型发起攻击时,开源基础设施却成为防御响应的一部分。

推理、服务与新的效率军备竞赛

  • Etched 的扩张是当日最明确的资本/基础设施公告:@Etched 完成 3 亿美元 C 轮融资,估值达 103 亿美元,用于加速推理集群生产,并在其办公地点附近开设了 8 万平方英尺/10 兆瓦的设施。其传达的信息非常明确:不训练前沿模型,而是“运行全球推理”。基础设施运营商和投资者的积极评论表明,人们对芯片侧推理专业化的理论存在真实兴趣,例如 @willdepue 和 @juberti。
  • 模型效率和推理架构仍是竞争焦点:@ArtificialAnlys 指出 OpenAI 的 GPT-5.6 Sol 效率设置在当前的 token 效率帕累托前沿中占据主导地位,而 @CoreWeave 发布了 MiniMax M3 的提供商速度基准,输出速率达 357 token/s,且综合价格较低。在开源推理领域,@vllm_project 在 vLLM 的 prime-rl 0.6.0 中描述了万亿级智能体 RL 推理管道,采用 FP8、专家并行、预填充/解码分离、KV 卸载和路由技术,用于在 28 个 H200 节点上以 131k 序列长度训练 GLM-5,单步时间低于 5 分钟。该帖子是目前最清晰地展示了现代 RL/智能体训练和推理堆栈如何融合的资料之一。

高互动推文(按互动量排序)

  • ChatGPT Voice 桌面版发布:@OpenAI 为 ChatGPT Work 和 Codex 推出桌面语音控制功能,可能是目前覆盖范围最广的纯产品发布。
  • OpenWorker : @AndrewYNg 推出一个开源的、与模型无关的本地代理工具,用于文件和办公场景工具。
  • Health in ChatGPT : @OpenAI / @ChatGPTapp 为美国用户推出医疗健康场景的连接功能。
  • FLUX 3 : @bfl_ai 发布统一的图像/视频/音频/动作预测模型,明显具有下游机器人应用的潜力。
  • The Stack v3 : @anton_lozhkov 发布迄今为止最大的开源代码数据集,成为未来代码模型竞赛的基础输入。

AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. 开源权重 AI 地缘政治与政府部署

  • 对开源的制裁。希望他们在这里不要做出愚蠢的举动。(活动量:2278):这张图是美国财政部长Scott B.在X平台发布帖子的截图,警告称虽然美国支持开源AI,但如果开源发布使所谓中国"隐蔽的工业级蒸馏攻击"和窃取美国知识产权的行为成为可能,可能会考虑实施制裁和实体清单指定(图片)。在Reddit语境中,技术担忧在于是否将从开放或可访问的前沿模型中进行模型蒸馏视为可制裁的知识产权盗窃,这可能抑制开源权重/模型发布和下游研究。评论者持怀疑和讽刺态度,认为此类制裁可能"适得其反"或在技术上难以站得住脚。有评论者质疑隐含的时间线,指出Fable5于7月1日发布,而Kimi K3于7月15日宣布,认为声称在15天内完成Fable级别的蒸馏模型是不现实的。另有评论者通过对比Fable5(7月1日发布)和Kimi K3(7月15日宣布)的时间线,质疑蒸馏/知识产权盗窃指控的技术可行性,认为仅用15天就产出可比蒸馏模型速度异常快,暗示在缺乏更有力证据的情况下该指控可能站不住脚。
  • 深度求索创始人4小时投资者会议纪要:深度求索优先AGI研发而非用户增长与商业化(活动:1030):据媒体报道的深度求索创始人梁文锋4小时投资者会议中文译本显示,该实验室明确将AGI实现概率置于短期商业化/用户增长之上,将产品开发、幻觉缓解、多模态能力和垂直领域代理视为次于代码代理→持续学习→AI自我迭代→具身智能的核心目标。据称梁文锋承诺其开源模型与内部部署模型完全一致,而非降级版本,并认为中美差距主要体现在算力/资源而非人才,同时重申对扩展规模的信念:"更大规模无疑会产生更优结果"。战略层面,深度求索声称将避开超级应用野心、视频/3D/世界模型开发及利润导向的API定价策略,强调低成本架构、开源和团队稳定性作为实现AGI的三大机制。评论者普遍对坦率态度和开源立场表示赞赏。有地缘政治观点认为,若中国实验室持续坚持开源AI战略,美国以盈利为导向的OpenAI/Anthropic实验室可能需要通过监管排除中国模型或保持足够技术领先优势来抵消中国快速追赶。有评论者质疑深度求索AGI优先策略的核心技术假设:尽管模型持续改进,但认为当前LLM风格的扩展和训练方法是否能真正导向AGI仍存疑,指出"AGI本身目前似乎并未比以往更接近实现"。这将投资者会议策略定位为依赖未解决的研究假设,而非单纯的执行效率或商业化速度。讨论重点之一聚焦于中国支持的开源AI与美国盈利导向实验室的竞争影响。评论者认为,若中国实验室持续发布强大开源模型,美国企业可能需要通过监管排除中国模型,或保持OpenAI/Anthropic的技术领先优势,使中国竞争者在每代技术迭代中始终落后约1年以上。
  • 🇦🇹 奥地利正在部署基于Mistral模型和Open WebUI的政府AI平台(活动:592):图片展示了奥地利GovGPT网页界面,标注为用于“文本和文档”的AI工作区,与报道中提到的平台采用Open WebUI作为前端、在主权BRZ联邦数据中心基础设施上运行Mistral开源权重模型的描述一致。据帖子来源信息显示,该平台计划覆盖约18万名奥地利联邦公务员,应用场景包括免费聊天、文档摘要、文档问答、内部知识库、电子文件分析、议会请求,以及后续的智能代理工作流——这成为开源权重大语言模型在公共部门的重要现实部署案例。评论区观点呈现两极分化,既有玩笑也有实际支持:一位技术人员指出如果系统能连接政府文件将非常实用,因为大语言模型在检索上下文时表现优异;奥地利网友则认为这是一次强有力的本地可部署/公共部门AI概念验证,未来可替换为更强或微调后的模型。有评论者强调该平台的核心价值将来自检索/上下文锚定而非基础模型的参数知识:如果奥地利能索引“所有背后的政府文件”,大语言模型将帮助公民比单纯依赖训练数据更高效地处理流程和表格。奥地利网友将此次部署视为本地可托管/公共部门AI的概念验证,指出后端未来可替换为更强或微调后的模型。他们强调即使是一个“普通模型”也可能带来行政效率提升,因为许多任务具有重复性、文档密集和流程化特征。一位技术评论者质疑模型选择,认为Mistral Medium 3.5仅与Gemma 4 31B和Qwen 3.6 27B等替代方案“处于同等水平”,暗示奥地利可能出于除原始基准竞争力以外的其他原因选择了Mistral模型。
  • 中国Kimi K3引发担忧:安全限制阻碍美国AI发展(活动:542):SCMP报道称,Moonshot AI的开源权重Kimi K3是一款2.8万亿参数模型,在Aikido Security的私有网络安全基准测试中发现了23/26个近期漏洞,表现与OpenAI GPT-5.6 Terra相当,接近GPT-5.6 Sol,同时成本显著更低。该报道将此视为证据,表明美国前沿实验室的网络安全防护措施、拒绝策略以及仅限API访问的方式,可能在防御性漏洞分析和补丁修复方面,相比DeepSeek、Qwen、Kimi和GLM等中国开源权重系统存在实用性劣势。评论者认为,美国AI竞争力受到的伤害更多来自过度监管、封闭API、高定价和排他性,而非原始能力限制,而中国实验室因芯片制裁等因素受益于开源权重共享。多位评论者将这种动态类比为中国电动车产业:美国限制可能使国内用户孤立,而世界其他地区则采用更便宜、更开放的中国技术。多位评论者指出,美国前沿实验室的封闭API策略可能促使开发者转向DeepSeek、Qwen、Kimi和GLM等中国开源权重生态系统。一项技术主张称,芯片制裁迫使中国实验室通过共享权重、研究和优化技术进行合作,而美国实验室则越来越依赖专有API和更重的合规层。具体可用性投诉提到安全过滤干扰编程工作流:一位用户称“Fable查看C代码时每次都坚决拒绝”,暗示安全分类器可能过度拒绝低级系统代码如C语言,这虽然可能与漏洞或恶意软件领域重叠,但也常见于合法开发中。

2. 蒸馏指控与合成数据

  • 荒谬的主张:蒸馏模型的表现优于原始模型(活动:2088):该图是一张“前端代码竞技场”的排行榜式基准图表,声称Kimi-K3以1679分排名第一,领先于所谓前沿模型如Claude Fable 5(1631分)和GPT-5.6 Sol(1599分)(图片)。该帖子认为这种图表被用来支持一种“荒谬”的政策叙事:即一个据称经过蒸馏的中国模型可能超越其源模型/原始模型,作者则从时间线可行性及蒸馏技术的局限性两个层面提出质疑。评论区未提供太多技术证据,主要将问题框架为地缘政治/政策动机,例如认为对中国“公平竞争”的批评存在双重标准,或认为禁令的推动是因为竞争对手“无法战胜他们”。有评论者质疑“蒸馏模型无法超越源模型”的前提,指出微调方法(如强化学习)可以通过改变模型行为向偏好响应方向偏移,而无需改变基础预训练分布。这意味着“蒸馏”性能比较并不直接:学生模型可能通过结合自身预训练、RLHF/RLAIF、合成数据和教师模型信号,在某些评估中超越教师模型。一个技术性较强的讨论线区分了“Kimi未使用蒸馏”和“Kimi使用了部分蒸馏,但这并不意味着它是克隆品”。评论者认为,在没有教师模型影响的情况下,Kimi输出与Anthropic模型的相似性在统计上极不可能出现,同时指出蒸馏可以发生在多个阶段和强度,从合成数据增强到定向微调。有评论者批评使用盲测人类偏好基准作为证据,证明Kimi比其所谓教师模型更强大。他们指出此类基准衡量的是对采样输出的偏好,而非必然反映底层智能、推理鲁棒性或通用基准能力,因此蒸馏模型在该排行榜上表现更好并不能排除蒸馏的可能性。
  • 关于“模型蒸馏”指控的争议被过度夸大(活动:529):该截图是一张非技术性的新闻风格图片,声称Anthropic将向作者支付15亿美元以应对使用受版权保护书籍训练Claude模型的指控;该帖子以此为背景,提出更广泛的论点,即由于定价、合规/知识产权风险、数据泄露和供应商锁定等问题,团队应减少对封闭式AI API的依赖。作者认为“蒸馏”指控在语义上被过度延伸:真正的模型蒸馏通常涉及从教师模型的logits进行学习,而Claude风格的生成输出更准确地描述为合成训练数据生成,尤其是封闭式API不暴露logits。评论者更关注赔偿和爬虫影响而非蒸馏问题,其中一人指出每本书214美元的赔偿金额似乎偏低,另一人则指控Anthropic的爬虫程序实际上对他们的网站发起DDoS攻击。一名自称为集体诉讼原告的用户表示,他们获得的赔偿金额超过了文中提到的250美元,大致相当于两本被指控下载书籍一年的版税收入。有评论者指出,Anthropic的爬虫程序对网站的访问强度足以被视作DDoS攻击,这引发了关于AI训练数据收集的具体操作问题:爬虫访问频率限制、robots.txt合规性以及对网站运营商基础设施成本的影响。作者协会集体诉讼中的一名原告表示,他们预期获得的赔偿金额超过了讨论中的250美元,大致相当于两本被指控下载书籍一年的版税收入,为AI训练数据诉讼中的赔偿规模提供了现实数据参考。一名评论者指出,该话题此前已在一篇配有主要文章链接的帖子中讨论过,而非使用Twitter截图,指向更早的LocalLLaMA讨论线:Anthropic声称本地模型正在窃取……
  • 模型“蒸馏”指控目前被严重夸大(活动量:441):该帖子指出,许多声称强大开源模型是“从GPT-4/Claude蒸馏而来”的说法,混淆了真正需要访问教师模型logits/完整词汇概率分布的基于token级别的知识蒸馏,与从公共API文本补全中使用合成数据进行微调。它指出API输出通常受到防护机制/路由层过滤(例如类似Lyzr Control Plane的控制平面式内容审核),因此在受限技术领域表现出色并不能通过简单抓取受防护的补全结果来解释;模型自我标识为“GPT”或“Claude”被视作数据污染的弱证据,而非竞争对手模型蒸馏的证明。顶部评论普遍认为该技术区分有效但对公众讨论无关紧要:一旦讨论涉及logits等术语,大多数非技术受众会失去兴趣,而技术读者早已理解营销/法律上的模糊性。其他评论将争议框架为情感或政治驱动而非证据驱动,有评论者甚至开玩笑称“没人会在2026年夏天蒸馏GPT-4”。多位评论者指出,公众指控依赖于logits等技术概念及模型蒸馏的实际定义,但这种技术细节在非技术社区(如LocalLLaMA)之外难以传达。隐含的技术区分在于,重复使用证据需要超越模糊的行为相似性或营销声明;大多数非技术受众无法判断模型是否通过另一个模型的输出、logits或合成数据进行训练。有评论指出,针对中国实验室的指控忽视了中国大量开放论文、模型发布和独立迭代的成果,同时指出大多数人缺乏对蒸馏前沿模型所需计算/数据/流程的具体认知。技术要点在于,可信的蒸馏声明需要考虑可行性与方法论,而非假设能力从封闭模型转移。

3. 浏览器代理与权重编辑研究

  • microsoft/Fara1.5-27B · Hugging Face (活动: 479): Microsoft Research AI Frontiers 发布了 microsoft/Fara1.5-27B,这是一个专为浏览器设计的仅视觉多模态计算机使用代理。该模型通过接收屏幕截图和文本轨迹历史记录,生成结构化操作指令,如点击、输入、滚动、访问网址和网页搜索等,并附带像素坐标等具体参数。该模型基于 Qwen3.5-27B 使用 FaraGen1.5 生成的合成任务/轨迹数据进行监督微调,建议与 MagenticLite 配合使用,同时提供较小的配套模型 Fara1.5-4B 和 Fara1.5-9B。主要局限性包括缺乏 DOM/无障碍树感知能力、仅使用英文训练数据、易受视觉提示注入/UI歧义影响、多步骤错误累积、运行间差异显著以及页面状态幻觉/误判等问题。评论者质疑为何选择基于中文 Qwen 家族模型(具体为 Qwen3.5-27B)进行微调,并询问微软未采用 DOM、无障碍树或 OCR 输入的原因。有技术分析指出,仅视觉设计可能部分源于 token 预算限制,甚至 URL 元数据也被报告进行了长度裁剪。评论者注意到 Fara1.5-27B 看起来是基于 Qwen 27B 基础模型微调而来,引发关于微软依赖阿里巴巴 Qwen 家族模型而非自主研发 MAI 小型"计算机使用"基础模型的讨论。有技术导向的问题询问为何模型未采用更丰富的计算机使用信号(如 DOM 树、无障碍 API 或 OCR)。有评论者从论文中推断设计可能受 token 预算限制,指出即使有用的元数据如 URL 也被承认但被大幅缩短长度。
  • 我直接手动将事实写入 Llama-3.1-8B 的权重中——没有微调、没有 LoRA、没有 RAG。还开发了一个酷炫的可视化工具,这里有一个实时地图显示每个事实在物理上存储的位置。(活动:315):该文章展示了一种机制可解释性风格的方法,通过追加/使用经过测量的 MLP 区域和手工构建的神经元电路,而非微调、LoRA 或 RAG,将显式事实“烘焙”进 Llama-3.1-8B 中,声称基础权重保持原样,并通过已知事实回忆和语言模型损失检查进行了验证。作者在 albertmi.ai 上演示了交互式神经元可视化工具和烘焙服务,并展示了一个包含 502 个维基百科事实的模型;每个事实被描述为具有局部化组件——“代码键”靠近第 6 层,读取器靠近第 25 层,链式神经元和后期层救援机制,其消融实验会移除该事实。通过 Zenodo 链接了一篇论文:doi:10.5281/zenodo.21502811。主要评论者关注验证和副作用:是否会导致无关问答或分布行为退化、编码答案是否变得异常可能,以及这是否能作为持久记忆机制,由较小模型决定存储内容并将其烘焙进自身。多位评论者聚焦于直接权重编辑是否会在插入事实之外引发灾难性副作用:在无关提示上性能退化、对无关问题输出编码答案的可能性增加,或干扰现有知识。关键技术担忧是该方法是否保留了模型原始分布,或引入局部过拟合/激活吸引子。一个技术性较强的讨论线将该方法与可能的持久记忆系统进行了类比:与 LoRA、微调或 RAG 不同,较小模型可决定保留哪些事实,然后永久编码到自身权重中。尚未解决的实现问题是如何自动化事实选择和插入,同时防止模型损坏或积累过时/错误记忆。一位评论者将该工作与激活/表征引导联系起来,询问为何“主动引导”尚未成为当前大语言模型中诱导内部状态或持久行为改变的核心方法。另一位评论者指出,如果该过程产生修改后的模型产物,将更加强化校验和验证的必要性,以检测被篡改或静默编辑的权重。

非技术类 AI 论坛摘要

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Kimi K3 蒸馏与制裁声明

使用 7 天免费试用继续阅读

订阅 Latent.Space 以继续阅读本文并获得 7 天免费访问完整文章档案的权限。

开始试用

已是付费订阅者?

上一篇

下一篇文章