MLCommons Releases New MLPerf Storage v3.0 Benchmark Results
MLPerf Storage v3.0新增KV Cache和Vector Database测试,并支持S3访问层,提升AI存储性能评估。
入选理由:v3.0新增KV Cache测试,用于评估LLM推理缓存性能
公司
发布MLPerf基准的非营利组织
已跟踪 10 条高相关材料
最近变化
2026-09-01 · v3.0新增KV Cache测试,用于评估LLM推理缓存性能
为什么值得关注
MLCommons 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
MLCommons Releases New MLPerf Storage v3.0 Benchmark Results
MLCommons · 8.5 分
MLPerf Storage v3.0新增KV Cache和Vector Database测试,并支持S3访问层,提升AI存储性能评估。
The key to trustworthy AI evaluation is secrecy by design
MLCommons · 8.5 分
通过设计保密性实现可信AI评估,首次双盲评估确保模型和数据安全。
MLPerf Client v2.0 Expands AI PC Benchmarking with Image Generation and Agentic AI
MLCommons · 8.5 分
MLPerf Client v2.0新增图像生成和智能代理AI基准,提升PC端AI性能评估。
已收录 10 条与 MLCommons 相关的内容,按评分排序。
MLPerf Storage v3.0新增KV Cache和Vector Database测试,并支持S3访问层,提升AI存储性能评估。
入选理由:v3.0新增KV Cache测试,用于评估LLM推理缓存性能
MLPerf Client v2.0新增图像生成和智能代理AI基准,提升PC端AI性能评估。
入选理由:新增图像生成基准采用Flux.2 klein 4B实验模型
通过设计保密性实现可信AI评估,首次双盲评估确保模型和数据安全。
入选理由:双盲评估结合加密计算可防止模型权重和测试数据泄露
企业应通过五个关键问题评估基准测试的可信度,以避免被误导。MLCommons提出基准测试需满足目标相关性、数据清洁性、可重复性等要求。
入选理由:基准测试的失效常见于数据污染,如系统在训练中接触过测试数据。
MLPerf Endpoints v0.7发布,提供动态、全面的AI推理基准,支持企业采购决策。
入选理由:MLPerf Endpoints v0.7支持自动化提交和实时结果可视化
MLPerf v6.0新增稀疏计算基准,推动AI系统多样性,DeepSeek V3参数达6710亿。
入选理由:DeepSeek V3使用6710亿参数,激活370亿参数/令牌,验证大规模稀疏训练系统。
MLPerf Tiny基准测试为超低功耗AI设备提供统一评估标准,推动边缘AI在工业、农业等场景的落地。
入选理由:MLPerf Tiny通过统一工作负载和测量方法解决设备差异问题
MLPerf新增多轮代理推理基准,通过Kimi和Qwen模型评估LLM服务系统在上下文增长、KV缓存复用等场景下的性能。
入选理由:代理推理基准需支持上下文增长和KV缓存复用优化
MLCommons推出MLPerf Inference v6.1边缘代理推理基准,使用Qwen3.6-27B量化模型评估边缘设备多轮对话性能。
入选理由:Qwen3.6-27B模型采用Q4_K_M GGUF量化格式部署
MLCommons与Google Cloud合作,利用Confidential Computing技术实现安全的医疗AI基准测试,保护患者数据和模型IP,推动脑肿瘤分割模型的可信评估。
入选理由:联邦学习使AI模型在数据方本地运行,避免患者数据泄露