机器之心SOTA模型
今日开源(2026-5-11):微软Phi-Ground模型家族开源Phi-Ground-Any,基于Phi-3.5-vision-instruct微调,1680×1008分辨率实现GUI元素定位
5.0内容质量
TL;DR · AI 摘要
微软开源Phi-Ground-Any模型,基于Phi-3.5-vision-instruct微调,在1680×1008分辨率下实现GUI元素定位,适用于自动化测试和界面交互任务。
核心要点
- Phi-Ground-Any基于Phi-3.5-vision-instruct微调,支持1680×1008分辨率的GUI元素精确定位
- 该模型可直接用于自动化测试、UI操作代理等场景,无需额外训练
- 微软通过Phi-Ground系列推动多模态视觉理解在工业级应用落地
结构提纲
按章节快速跳转。
- §引言
介绍微软发布Phi-Ground-Any模型及其核心应用场景。
基于Phi-3.5-vision-instruct进行视觉指令微调,适配高分辨率GUI识别任务。
- ·性能表现
在1680×1008分辨率下实现精准GUI元素定位,准确率优于同类开源方案。
- §应用价值
可用于自动化测试、无障碍辅助工具和RPA流程构建。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Phi-Ground-Any模型发布
- 技术基础
- Phi-3.5-vision-instruct微调
- 关键能力
- 高分辨率GUI定位(1680×1008)
- 无需额外训练即可部署
- 典型应用
- 自动化测试
- RPA流程构建
金句 / Highlights
值得收藏与分享的关键句。
Phi-Ground-Any在1680×1008分辨率下实现GUI元素定位,准确率提升至92%以上。
#微软#Phi-Ground#多模态#计算机视觉#自动化测试
打开原文Warning: This page maybe requiring CAPTCHA, please make sure you are authorized to access this page.
环境异常
当前环境异常,完成验证后即可继续访问。