使用 ADK 构建长期运行的 AI 代理
本文介绍了一种使用 ADK 构建长期运行的 AI 代理的方法,该代理可以在暂停和恢复后仍然保持上下文。
入选理由:ADK 提供了持久内存模式、事件驱动的休眠门和多代理委托三种架构转变。
每日 AI 资讯雷达
2026-05-13 当日 traeai 收录 60 条 AI 技术与产品资讯,按评分排序,每条带 AI 摘要、要点与原文链接。
canonical: https://www.traeai.com/daily/2026-05-13
k6 2.0正式发布,引入AI辅助测试工作流,新增k6 x agent等4个CLI命令支持与Claude Code等AI工具深度集成,提升测试自动化效率50%以上。
AI编码代理的攻击面已从源代码扩展至配置文件、指令文件等四类文件,Google Threat Intelligence通过VirusTotal Code Insight实现语义级威胁分析,有效防御供应链攻击。
Codex 帮助财务团队更高效地准备月度业务审查、报告、差异分析和规划,无需编码。
本文介绍了一种使用 ADK 构建长期运行的 AI 代理的方法,该代理可以在暂停和恢复后仍然保持上下文。
入选理由:ADK 提供了持久内存模式、事件驱动的休眠门和多代理委托三种架构转变。
AI编码代理的攻击面已从源代码扩展至配置文件、指令文件等四类文件,Google Threat Intelligence通过VirusTotal Code Insight实现语义级威胁分析,有效防御供应链攻击。
入选理由:AI代理攻击面包含What executes(执行)、What instructs(指令)、What connects(连接)、What extends(扩展)
k6 2.0正式发布,引入AI辅助测试工作流,新增k6 x agent等4个CLI命令支持与Claude Code等AI工具深度集成,提升测试自动化效率50%以上。
入选理由:k6 2.0新增k6 x agent命令,使AI助手能自动生成符合k6规范的测试脚本,减少人工编写时间50%+。
文章探讨了AI支出不再仅仅是IT预算问题,而是涉及整个组织的资本分配纪律。CFO们现在要求AI投资产生可衡量的业务成果,而非单纯的实验。
入选理由:AI支出已跨越部门界限,成为资本分配问题,而非简单的软件采购问题。
OpenAI和Google分别推出了新的部署公司,通过雇佣大量工程师帮助客户采用AI技术,这标志着AI行业正在回归到20世纪70年代的计算模式,即由企业高管主导的技术变革。
入选理由:OpenAI成立了一个新的子公司,投资40亿美元,收购Tomoro咨询公司,以帮助企业部署AI系统。
本文提出了一种针对生产环境中AI代理的12指标评估框架,涵盖检索、生成、代理行为及生产性能四个维度,帮助团队在部署前全面评估AI系统的可靠性与表现。
入选理由:12指标框架包括检索相关性、上下文忠实度、幻觉率等关键指标,确保AI代理在生产环境中的表现。
本文探讨了如何通过监督微调将一个小型语言模型转变为具有特定人格的C-3PO。实验表明,第一人称陈述比对话演示更有效,而合成文档则在传授角色知识方面表现更好。
入选理由:第一人称陈述在泛化能力上优于对话演示。
本文探讨了美国在关键矿物供应和电力基础设施现代化方面的挑战,强调自动化、强化学习和垂直整合操作的重要性,以及如何通过技术创新和政策改革加速这些领域的进展。
入选理由:美国在关键矿物供应方面落后中国50多年,需加快现代化步伐。
Luke Alvoeiro 在播客中介绍了五种多智能体架构类型,强调了多智能体系统在解决注意力瓶颈方面的潜力,并展示了如何通过 Missions 系统实现长时间自主任务。
入选理由:多智能体系统的核心在于解决人的注意力瓶颈,而非单纯提升智能。
3Blue1Brown 解释了子集和问题,这是一个经典的计算机科学难题,探讨了其背后的数学原理和算法复杂性。
入选理由:子集和问题是 NP 完全问题,没有已知的多项式时间解决方案。
AI加速开发提高了代码生产速度,但并未改变代码库安全吸收这些代码的速度。忽视了这一差距会导致生产环境中出现意外故障。文章强调了通过持续重构来提高系统对频繁变化的吸收能力的重要性。
入选理由:AI生成的代码可能隐藏未显式的边界假设、并发假设、领域假设和安全假设,导致生产环境中的意外故障。
谷歌在Android 17发布会上推出了Gemini Intelligence,使其成为智能系统而非传统操作系统,通过多模态、跨环境的AI能力提升用户体验,包括自动填入、智能语音输入和多步骤任务处理等功能。
入选理由:Android 17引入了Gemini Intelligence,使Android从操作系统升级为智能系统,支持多模态和跨环境的AI能力。
何恺明团队推出首个连续扩散语言模型ELF,仅用105M参数和45B训练token,在OpenWebText上将生成困惑度降至24,优于主流扩散语言模型。
入选理由:ELF采用连续扩散方法,仅需32步采样,生成困惑度达到24,优于主流扩散模型。
MatterSim 扩展了 AI 在材料科学中的应用,从更快的大规模模拟到 MatterSim-MT,一种新的多任务模型,能够模拟超出势能面的更多属性。
入选理由:MatterSim 提供了更快的大规模材料模拟能力。
Augment Code 使用 Mercury 2 作为专用子代理,实现了 82% 的上下文压缩速度提升和 90% 的摘要成本降低。
入选理由:使用 Mercury 2 作为专用子代理,上下文压缩速度提升了 82%。
Symphony 使用 Codex 代理自动处理任务,显著提高了开发效率。
入选理由:Symphony 自动处理了 50 个任务中的 30 个,删除了 7,000 行代码。
dnsmasq 发布了六个严重安全漏洞的 CVE,这些漏洞影响几乎所有非古早版本,修复补丁已发布。
入选理由:dnsmasq 发布了六个严重安全漏洞的 CVE,影响几乎所有非古早版本。
Karpathy 指出,AI 编码账单的 90% 花费在不必要的 context 上,通过优化 context 使用和路由策略,可以大幅降低成本。
入选理由:AI 编码账单的 90% 花费在不必要的 context 上。
迁移打包工具需谨慎,除非现有方案严重影响开发,否则不应盲目追求新技术。
入选理由:迁移打包工具的成本极高,可能导致线上业务出现问题。
95% 的 GenAI 试点未能进入生产阶段,而强化学习可以通过持续反馈和改进来系统地提高模型。
入选理由:95% 的 GenAI 试点未能进入生产阶段。
Google Cloud AI团队设计Gemini Enterprise时,强调用户体验应始终聚焦目标,同时确保用户能够干预,从而建立信任。
入选理由:设计代理工具的核心在于平衡AI的可接近性和强大性,同时确保用户信任。
视频解释了三个常见的AI术语:幻觉、上下文窗口和令牌,帮助理解它们的实际含义和应用场景。
入选理由:幻觉是创造力的另一面,取决于任务需求。
Amazon强制要求80%开发者使用AI并追踪Token消耗,导致员工用MeshClaw工具刷数据。这种tokenmaxxing现象反映硅谷大厂在2000亿美元AI投资下的回报焦虑,也暴露了AI Agent工具的安全风险。
入选理由:Amazon要求每周80%开发者使用AI工具,内部排行榜追踪Token消耗
Cloudflare发现了一个QUIC实现中的bug,该bug导致CUBIC拥塞控制算法在遇到网络拥塞时无法恢复,最终导致连接失败。
入选理由:CUBIC拥塞控制算法在Linux内核中的一个优化导致了QUIC实现中的bug。
现在可以通过 Vercel CLI 直接管理 Vercel 防火墙,包括配置自定义规则、IP 封锁、系统绕过规则、攻击模式和系统缓解措施。
入选理由:使用 `vercel firewall` 命令可以配置自定义规则。
本文介绍了如何构建一个能够在MV3服务工作器环境下稳定运行的Google Drive同步引擎,重点在于内存状态管理、离线处理和使用原生Fetch替代Google SDK。
入选理由:MV3强制采用严格的磁盘优先模型,所有用户操作立即保存到本地存储。
Docker 提出的 AI Governance 解决方案通过控制代理执行路径和工具调用路径来确保企业安全,适用于开发者的笔记本电脑和其他环境。
入选理由:Docker 的 AI Governance 解决方案在运行时层面上控制代理行为,确保安全。
Databricks 推出原生湖屋同步功能,实现数据湖和数据仓库之间的无缝集成,提升数据共享和治理能力。
入选理由:原生湖屋同步功能支持零拷贝数据共享,提高数据访问效率。
Needle 是一个仅 26MB 的函数调用模型,能够在极小的设备上运行,适用于边缘计算和物联网应用。
入选理由:Needle 模型大小仅为 26MB,适合在资源受限的设备上运行。
LiteParse 是一款开源、无模型的文档解析器,支持 50 多种文档类型,能够快速解析复杂布局的文档并提取干净文本,同时支持轻量级 OCR 集成。
入选理由:LiteParse 支持 50 多种文档类型,包括复杂的文本布局和表格。
Agent Harness 是决定 AI 模型能否真正执行任务的关键工程系统,包括工具、权限、上下文、执行环境和结果验证。
入选理由:Agent Harness 决定了 AI 模型能否执行实际任务,而不仅仅是提供建议。
GB 200s 提高了大型 MoE 模型如 Qwen 的预填充和解码分离效率,相比 Hopper 平台,吞吐量显著提升。
入选理由:GB 200s 在高吞吐量推理方面比 Hopper 更适合大型 MoE 模型。
Perplexity 发布了关于如何在 NVIDIA GB200 NVL72 Blackwell 机架上部署 Qwen3 235B 模型的研究,GB200 在大规模 MoE 模型的高吞吐量推理方面优于 Hopper。
入选理由:Qwen3 235B 模型在 NVIDIA GB200 上实现了高效的高吞吐量推理。
NVLS 全归约延迟显著改善,从 H200 的 586.1 微秒降至 GB200 的 313.3 微秒,MoE 预填充和解码吞吐量也有显著提升。
入选理由:NVLS 全归约延迟从 H200 的 586.1 微秒降至 GB200 的 313.3 微秒。
NVIDIA 平台通过多种优化技术,成为大规模模型推理的最佳平台,显著降低服务成本并提高性能。
入选理由:NVIDIA 平台通过预填充/解码分离、Blackwell 原生量化、自定义内核和机架级 NVLink 提高了大规模模型推理的性能。
Databricks Data Intelligence Platform 帮助体育团队利用海量追踪数据,提高球员健康、比赛成绩和整体运营效率。
入选理由:NBA 使用 Sony Hawk-Eye 的 SkeleTRACK 系统,每场比赛生成约 6500 万个位置记录。
世界模型是当前 AI 领域的重要趋势,涉及如何让 AI 更好地理解现实世界。
入选理由:世界模型帮助 AI 更好地理解现实世界的复杂性。
AutoScout24通过采用AI工具如ChatGPT和Codex,显著提高了开发效率和代码质量,缩短了项目交付时间。
入选理由:AutoScout24将开发周期从2-3周缩短到2-3天。
Parameter Golf挑战赛展示了AI辅助研究的潜力,包括训练优化、量化、测试策略和新模型创意。
入选理由:超过1,000名参与者提交了2,000多个方案,展示了广泛的技术创造力。
NVIDIA 工程师和研究人员使用 Codex 进行复杂工程工作和端到端机器学习实验,显著提高了开发效率和系统性能。
入选理由:Codex 在 NVIDIA 的生产系统构建中发挥了重要作用,显著提高了代码质量和开发效率。
尽管单个 AI 令牌价格下降,但企业整体 AI 支出仍在增加,因为更多的工作通过 AI 完成,导致总成本上升。
入选理由:单个 AI 令牌价格下降鼓励更多消费,导致总支出增加。
Codex 帮助财务团队更高效地准备月度业务审查、报告、差异分析和规划,无需编码。
入选理由:Codex 可以将现有的工作簿、仪表板和预测更新转化为 CFO 就绪的月度业务审查叙事。
Temporal Reasoning 层通过时间签名管理记忆,显著提高了长期运行代理的记忆准确性。
入选理由:Temporal Reasoning 在 LoCoMo 基准测试中将整体准确率从 86.1% 提高到 90.2%,特别是在多跳问题上。
中国开放的AI生态系统通过减少重复研发计算成本,提高了模型开发的效率和可持续性。
入选理由:中国AI生态系统的开放性减少了重复的研发计算成本,使实验室能够持续更长时间。
使用 GitHub Copilot CLI 构建了一个程序生成的 Roguelike 游戏,展示了 AI 辅助开发的实际应用。
入选理由:GitHub Copilot CLI 可以显著提高开发效率,特别是在处理复杂逻辑时。
本文详细介绍了如何在浏览器中编写、测试和部署第一个 WebAssembly 程序和 Web 应用,无需安装任何软件。
入选理由:WebAssembly 允许 C、C++ 和 Rust 等编译语言直接在浏览器中以接近原生速度运行。
Qdrant 1.18 发布,引入了由 Google Research 开发的新量化方法 TurboQuant,提供更高的内存效率和更好的召回率。
入选理由:TurboQuant 提供与标量量化(SQ)相似的召回率,但内存使用减少 50%。
Proxy-Pointer框架通过结构感知的企业文档智能,实现高效、精确的文档比较,适用于复杂金融协议和学术论文。
入选理由:Proxy-Pointer框架结合层次嵌入和轻量级LLM重排序器,能够精确提取文档中的语义对齐区域。
文章探讨了生产环境中RAG系统的混合搜索和重排序技术,解决了密集向量检索在特定技术查询中的不足。
入选理由:密集向量检索在概念性查询中表现良好,但在特定技术查询中存在不足。
Jina AI 发布 v5-omni 模型,保留 v5-text 主干并添加预训练的视觉和音频编码器,通过小型可训练投影器连接。
入选理由:v5-omni 保留 v5-text 主干,完全冻结其参数。
本文探讨了从 vibe coding 转向 spec-driven development 的必要性和实践方法,强调了后者在团队协作和项目管理中的优势。
入选理由:Vibe coding 适用于简单项目,但在大型项目中缺乏最佳实践和共享规范。
高级工程师如何通过技术清晰度、团队对齐和有意图的文档来扩大影响力和推动变革。
入选理由:技术清晰度有助于建立信任,使团队成员更好地理解问题。
在搜索结果不理想时,降级比过滤更好,因为后者会排除特定用户需要的结果。
入选理由:降级结果比完全过滤更能满足特定用户的需求。
本文介绍了五个实用的 Python 脚本,用于处理时间序列数据中的常见任务,包括重采样、异常检测、趋势分解等。
入选理由:提供了五个 Python 脚本,涵盖时间序列数据处理的常见任务。
Polars 在处理大规模数据集时比 Pandas 更快,特别是在并行计算和懒加载方面。
入选理由:Polars 使用 Rust 构建,支持并行计算和懒加载,性能优于 Pandas。
MatterSim-v1 在实验验证、加速模拟和多任务模型方面取得进展,提高材料设计效率。
入选理由:MatterSim-v1 预测并实验合成了高热导率材料 TaP,其热导率为 152 W/m/K。
多代理RAG系统可能因检索到低相关性或过时文档而产生错误,但输出看起来仍然自信且正确。
入选理由:多代理RAG系统的错误往往在输出层不可见,因为每个代理都会将前一个代理的错误视为事实。
本文介绍了七款领先的LLM可观测性工具,帮助AI工程师监控、评估和调试生产环境中的大型语言模型应用。
入选理由:LangSmith 提供全面的开发和生产生命周期支持,适用于使用 LangChain 或 LangGraph 的团队。
AWS提出了一种混合多租户架构,通过预集成模型、Route 53加权路由、PrivateLink连接和分层架构,解决了大规模广告服务平台中的隔离性和效率问题。
入选理由:通过预集成模型,将VPC、IAM角色和下游服务连接配置一次并复用,减少了重复工作。