https://t.co/wyA9Gm54vW
现有回忆基准测试已饱和,无法准确评估代理系统,需转向行动基准测试并关注成本指标。
入选理由:现有回忆基准测试已饱和,GPT-4o在LongMemEval中得分0.606
论文
别名:DolphinBench论文
评估16个记忆基准测试的论文
已跟踪 3 条高相关材料
最近变化
2026-09-29 · 现有回忆基准测试已饱和,GPT-4o在LongMemEval中得分0.606
为什么值得关注
DolphinBench 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
https://t.co/wyA9Gm54vW
mem0(@mem0ai) · 8.5 分
现有回忆基准测试已饱和,无法准确评估代理系统,需转向行动基准测试并关注成本指标。
Launching DolphinBench - agent memory benchmark that grades action after long history and measures a...
Taranjeet(@taranjeetio) · 8.5 分
DolphinBench 是首个综合评估代理记忆的基准测试,可同时测量长历史操作准确性、成本和延迟。
Benchmark announcement: https://t.co/33mlCQKoH4 Website: https://t.co/kHE7H7docE Leaderboard: https...
mem0(@mem0ai) · 6 分
mem0.ai 发布 DolphinBench 基准测试,提供 AI 模型评估工具和数据集,但缺乏技术细节。
已收录 3 条与 DolphinBench 相关的内容,按评分排序。
现有回忆基准测试已饱和,无法准确评估代理系统,需转向行动基准测试并关注成本指标。
入选理由:现有回忆基准测试已饱和,GPT-4o在LongMemEval中得分0.606
DolphinBench 是首个综合评估代理记忆的基准测试,可同时测量长历史操作准确性、成本和延迟。
入选理由:DolphinBench 填补了现有基准在代理记忆评估的空白
mem0.ai 发布 DolphinBench 基准测试,提供 AI 模型评估工具和数据集,但缺乏技术细节。
入选理由:DolphinBench 提供 AI 模型评估工具,包含数据集和排行榜