Anthropic 内部对谈:Harness 那套外壳流程,正在被拆掉 套在模型外面那层代码(harness)正在变薄:它编码的是「模型做不到什么」的假设,而这些假设正在随着模型能力的提升而过期.....
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
入选理由:旧Harness像流水线,每个环节固定且顺序严格
人物
别名:xiaohu
技术分享者,发布AI行业观察。
已跟踪 30 条高相关材料
最近变化
2026-07-19 · 旧Harness像流水线,每个环节固定且顺序严格
为什么值得关注
小互 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Anthropic 内部对谈:Harness 那套外壳流程,正在被拆掉 套在模型外面那层代码(harness)正在变薄:它编码的是「模型做不到什么」的假设,而这些假设正在随着模型能力的提升而过期.....
小互(@imxiaohu) · 8.5 分
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
豆包实时语音模型3.0 API 上线 看演示还是很牛P的,能干不少事情了 全双工:能同时听和说,像真人聊天那样可以随时插话 端到端:语音进、语音出,不进行转录,更快、更自然。 精准遵循 + 适...
小互(@imxiaohu) · 8.5 分
豆包实时语音模型3.0 API 上线,支持全双工、端到端语音处理和自定义工具调用。
跨语言测试 WER (词错率)多个方向 上拿了第一名,错字最少 中文声说英文:3.19(CosyVoice2 是 17.10) 韩文声说英文:3.42(CosyVoice3 是 13.70)
小互(@imxiaohu) · 7.5 分
小互发布的评测结果显示其语音转换技术在跨语言WER测试中表现优异,中文转英文WER仅3.19%,韩文转英文WER仅3.42%,显著优于CosyVoice等竞品。该结果展示了多语言语音合成技术的重要突破。
已收录 30 条与 小互 相关的内容,按评分排序。
Anthropic正在重构模型外围的Harness流程,从固定流水线转向动态策略调整,因模型能力提升使原有假设失效。
入选理由:旧Harness像流水线,每个环节固定且顺序严格
豆包实时语音模型3.0 API 上线,支持全双工、端到端语音处理和自定义工具调用。
入选理由:豆包实时语音模型3.0支持全双工交互,实现类似真人聊天的实时对话。
Results released by Xiaohu show their speech conversion technology performs excellently in cross-language WER tests, with Chinese-to-English WER at only 3.19% and Korean-to-English WER at only 3.42%, significantly outperforming competitors like CosyVoice. This demonstrates significant breakthroughs in multilingual speech synthesis technology.
入选理由:小互技术中文转英文WER为3.19%,远优于CosyVoice2的17.10%
The article shares insights on handling business relationships learned by a founder in Shenzhen, emphasizing cultural sensitivity and interpersonal interaction.
入选理由:在创业过程中,理解并尊重当地文化习俗对建立良好商业关系至关重要。
Xiaohu's open-source video translation tool can automatically complete downloading, transcribing, translating, and subtitling, suitable for developers who need to quickly process multilingual video content.
入选理由:小互开源工具支持自动下载、转写、翻译和字幕生成,简化视频处理流程。
Cursor's self-developed coding model Composer 2.5 matches Opus 4.7 performance with less than 1-point score gap, but costs 10-30x less: input tokens drop from $15 to ~$1.5 per million, output from $75 to ~$2.5. It shows clear improvements over Composer 2 in long-context tasks, complex instruction following, and collaboration smoothness.
入选理由:Composer 2.5评分与Opus 4.7差距不足1分,性能处于同一区间
Humans are currently slightly ahead of the Figure robot in parcel sorting tasks.
入选理由:直播显示人类在快递分拣任务中表现优于Figure机器人。
Claude Code launches Agent View, a unified interface to manage multiple tasks, improving efficiency in AI-assisted programming workflows.
入选理由:Agent View 可集中管理所有 Claude Code 任务的状态,避免多窗口混乱。
Claude Code launches Agent View, a unified interface to manage multiple tasks, enabling status visibility and quick switching to improve AI programming efficiency.
入选理由:Agent View 可集中管理多个 Claude Code 任务,避免窗口混乱。
GPT-Realtime-Whisper is a streaming speech-to-text model designed for real-time scenarios, supporting low-latency processing unlike the original Whisper which handles complete audio batches.
入选理由:新版模型支持流式处理,无需等待整段音频完成即可输出结果。
文章介绍了一个为Codex更换皮肤的项目,但内容过于简略,缺乏技术深度和实用价值。
入选理由:项目声称可为Codex更换皮肤,但未说明实现机制
小互展示了Claude代码副屏功能,通过可视化界面解决大段文字回答的可读性问题。
入选理由:副屏功能将Claude的回答转换为可视化页面,提升可读性
文章作者分享了个人IP配图技能的开源计划,但因未完善而延迟发布。
入选理由:作者计划开源个人IP配图技能,但因未完善而延迟发布。
该推文展示了一种通过拖拽照片实时替换直播摄像头人物的技术,但缺乏技术细节和深度。
入选理由:用户可通过拖拽照片实时替换直播摄像头中的人物。
文章介绍了动态判停技术在语音交互中的应用,但缺乏技术细节和深度分析。
入选理由:动态判停技术能精准识别用户是否完成发言。
文章介绍了如何在Codex中录制技能流程,但信息密度低,缺乏深度和实用性。
入选理由:在Codex中可通过插件菜单录制技能流程。
Claude 的语音模式即将推出,支持中文,但信息量有限,缺乏技术细节。
入选理由:Claude 的语音模式即将推出,支持中文。
Claude Code's weekly usage limit is temporarily increased by 50%, effective immediately and lasting until July 13, 2026, and can be stacked with last week's 5-hour doubling benefit.
入选理由:Claude Code 每周使用上限临时增加50%,持续至2026年7月13日。
The article exposes a false information about ByteDance cutting down 30% of its AI projects.
入选理由:该消息称字节2025年AI推理成本超80亿,但无可靠数据来源
一条带有自嘲意味的社交平台短帖,反思过度优化导致系统崩溃的现象,并类比推测 Opus 4.6 版本可能因类似原因出问题。
入选理由:过度迭代优化可能破坏原有稳定系统
Codex 新增宠物功能,支持8种形态、3种状态提示,可通过 /pet 命令或设置启用,可基于用户近期代码(如Rust)生成个性化宠物。
入选理由:宠物功能为 Codex 新增的轻量级 UI 交互彩蛋,非核心生产力特性
OpenAI 因滥用和欺诈机制错误标记账号导致 Codex 用量重置,引发用户不满。
入选理由:OpenAI 的滥用检测系统错误标记了部分用户账号。
The Manus incident triggered new Chinese outbound investment regulations, explicitly prohibiting export of state-restricted technologies and data, including indirect transfers via cross-border staffing or training.
入选理由:新规禁止投资者出口或使用国家禁止/限制出口的技术、服务及数据,违者将面临合规风险。
该推文展示了一项技术在嘈杂环境下的抗干扰能力,但缺乏具体机制、原理或数据支持。
入选理由:技术在嘈杂环境中表现良好,但未说明具体实现方式。
该推文内容信息密度低,缺乏技术深度和实用性,仅展示了Codex客户端的邀请好友功能界面。
入选理由:推文内容未提供技术细节或实用信息。
该推文内容缺乏技术深度和具体信息,无法为工程师提供有价值的见解。
入选理由:推文内容过于简略,没有提供具体的技术细节或测试方法。
Xiaohu posts a humorous tweet on X, expressing that they come from a poor background.
入选理由:小互表示自己出身不好
User complains about bot comment proliferation and rampant adult accounts on X platform, questioning the official product manager's claimed governance effectiveness.
入选理由:X平台存在大量机器人恶意评论问题
This is a short personal update on a social platform, lacking technical depth and practicality.
入选理由:此内容仅为个人感受分享,无具体技术信息。