Anthropic 内部对谈:Harness 那套外壳流程,正在被拆掉 套在模型外面那层代码(harness)正在变薄:它编码的是「模型做不到什么」的假设,而这些假设正在随着模型能力的提升而过期.....
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
入选理由:旧Harness像流水线,每个环节固定且顺序严格
人物
别名:xiaohu
技术分享者,发布AI行业观察。
已跟踪 30 条高相关材料
最近变化
2026-07-19 · 旧Harness像流水线,每个环节固定且顺序严格
为什么值得关注
小互 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Anthropic 内部对谈:Harness 那套外壳流程,正在被拆掉 套在模型外面那层代码(harness)正在变薄:它编码的是「模型做不到什么」的假设,而这些假设正在随着模型能力的提升而过期.....
小互(@imxiaohu) · 8.5 分
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
豆包实时语音模型3.0 API 上线 看演示还是很牛P的,能干不少事情了 全双工:能同时听和说,像真人聊天那样可以随时插话 端到端:语音进、语音出,不进行转录,更快、更自然。 精准遵循 + 适...
小互(@imxiaohu) · 8.5 分
豆包实时语音模型3.0 API 上线,支持全双工、端到端语音处理和自定义工具调用。
跨语言测试 WER (词错率)多个方向 上拿了第一名,错字最少 中文声说英文:3.19(CosyVoice2 是 17.10) 韩文声说英文:3.42(CosyVoice3 是 13.70)
小互(@imxiaohu) · 7.5 分
小互发布的评测结果显示其语音转换技术在跨语言WER测试中表现优异,中文转英文WER仅3.19%,韩文转英文WER仅3.42%,显著优于CosyVoice等竞品。该结果展示了多语言语音合成技术的重要突破。
已收录 30 条与 小互 相关的内容,按评分排序。
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
入选理由:旧Harness像流水线,每个环节固定且顺序严格
豆包实时语音模型3.0 API 上线,支持全双工、端到端语音处理和自定义工具调用。
入选理由:豆包实时语音模型3.0支持全双工交互,实现类似真人聊天的实时对话。
小互发布的评测结果显示其语音转换技术在跨语言WER测试中表现优异,中文转英文WER仅3.19%,韩文转英文WER仅3.42%,显著优于CosyVoice等竞品。该结果展示了多语言语音合成技术的重要突破。
入选理由:小互技术中文转英文WER为3.19%,远优于CosyVoice2的17.10%
文章分享了创业者在深圳学习到的商业关系处理技巧,强调文化敏感性和人际互动的重要性。
入选理由:在创业过程中,理解并尊重当地文化习俗对建立良好商业关系至关重要。
小互开源视频翻译工具可自动完成下载、转写、翻译和字幕生成,适合需要快速处理多语言视频内容的开发者。
入选理由:小互开源工具支持自动下载、转写、翻译和字幕生成,简化视频处理流程。
Cursor自研编码模型Composer 2.5性能对标Opus 4.7,评分差距不到1分,但价格低10-30倍,在长任务、复杂指令遵循和协作顺滑度上较Composer 2有明显提升。
入选理由:Composer 2.5评分与Opus 4.7差距不足1分,性能处于同一区间
Claude Code 推出多任务统一管理工具 Agent View,将多个任务会话集中到单一界面,提升 AI 编程协作效率。
入选理由:Agent View 可集中管理所有 Claude Code 任务的状态,避免多窗口混乱。
Claude Code 推出多任务统一管理工具 Agent View,将多个终端任务集中到单一界面,实现状态可视化与快速切换,提升 AI 编程协作效率。
入选理由:Agent View 可集中管理多个 Claude Code 任务,避免窗口混乱。
GPT-Realtime-Whisper 是一款专为实时场景设计的流式语音转文字模型,相比原版 Whisper 处理完整音频的方式,它支持边说边转且延迟极低。
入选理由:新版模型支持流式处理,无需等待整段音频完成即可输出结果。
文章介绍了一个为Codex更换皮肤的项目,但内容过于简略,缺乏技术深度和实用价值。
入选理由:项目声称可为Codex更换皮肤,但未说明实现机制
小互展示了Claude代码副屏功能,通过可视化界面解决大段文字回答的可读性问题。
入选理由:副屏功能将Claude的回答转换为可视化页面,提升可读性
文章作者分享了个人IP配图技能的开源计划,但因未完善而延迟发布。
入选理由:作者计划开源个人IP配图技能,但因未完善而延迟发布。
该推文展示了一种通过拖拽照片实时替换直播摄像头人物的技术,但缺乏技术细节和深度。
入选理由:用户可通过拖拽照片实时替换直播摄像头中的人物。
文章介绍了动态判停技术在语音交互中的应用,但缺乏技术细节和深度分析。
入选理由:动态判停技术能精准识别用户是否完成发言。
文章介绍了如何在Codex中录制技能流程,但信息密度低,缺乏深度和实用性。
入选理由:在Codex中可通过插件菜单录制技能流程。
Claude 的语音模式即将推出,支持中文,但信息量有限,缺乏技术细节。
入选理由:Claude 的语音模式即将推出,支持中文。
Claude Code 每周使用限额临时提升50%,可与此前5小时限额翻倍福利叠加,有效期至2026年7月13日,立即生效。
入选理由:Claude Code 每周使用上限临时增加50%,持续至2026年7月13日。
一条带有自嘲意味的社交平台短帖,反思过度优化导致系统崩溃的现象,并类比推测 Opus 4.6 版本可能因类似原因出问题。
入选理由:过度迭代优化可能破坏原有稳定系统
Codex 新增宠物功能,支持8种形态、3种状态提示,可通过 /pet 命令或设置启用,可基于用户近期代码(如Rust)生成个性化宠物。
入选理由:宠物功能为 Codex 新增的轻量级 UI 交互彩蛋,非核心生产力特性
OpenAI 因滥用和欺诈机制错误标记账号导致 Codex 用量重置,引发用户不满。
入选理由:OpenAI 的滥用检测系统错误标记了部分用户账号。
Manus事件触发中国对外投资新规,明确禁止出口国家禁限技术数据,包括通过跨境派遣、培训等方式变相转移,旨在防止核心技术外流。
入选理由:新规禁止投资者出口或使用国家禁止/限制出口的技术、服务及数据,违者将面临合规风险。
该推文展示了一项技术在嘈杂环境下的抗干扰能力,但缺乏具体机制、原理或数据支持。
入选理由:技术在嘈杂环境中表现良好,但未说明具体实现方式。
该推文内容信息密度低,缺乏技术深度和实用性,仅展示了Codex客户端的邀请好友功能界面。
入选理由:推文内容未提供技术细节或实用信息。
该推文内容缺乏技术深度和具体信息,无法为工程师提供有价值的见解。
入选理由:推文内容过于简略,没有提供具体的技术细节或测试方法。
用户抱怨X平台上机器人评论泛滥和黄色账号猖獗的问题,质疑官方产品经理声称的治理效果。
入选理由:X平台存在大量机器人恶意评论问题