AI Engineer视频
从46%到90%:为设备端代理微调小型LLM——Cormac Brick,Google
8.5内容质量
可直接观看的视频资源打开原视频
TL;DR · AI 摘要
Google的AI Edge平台通过优化小型LLM(如Gemini Nano)和代理技能,将设备端推理性能从46%提升至90%,支持跨平台部署并集成TensorFlow Lite运行时。
核心要点
- 使用TensorFlow Lite运行时和Lighter TLM,小型LLM(<1B参数)在设备端推理性能提升至90%
- Gemini Nano通过AI Core API预装在设备中,支持总结等API,优化延迟和隐私保护
- TensorFlow Lite支持27亿Android设备,Gemini 4模型在NPU/GPU上实现高效推理
结构提纲
按章节快速跳转。
介绍在设备端部署小型LLM(<1B参数)的动机,包括低延迟、隐私保护和离线使用等优势。
TensorFlow Lite作为跨框架运行时,支持MediaPipe和Lighter TLM模型部署,可运行于CPU/GPU/NPU。
通过AI Core预装Gemini Nano模型,提供总结等API,覆盖27亿Android设备。
Gemini 4模型在NPU/GPU上的部署实现高效推理,支持iOS/Android等多平台。
展示基于系统GenAI构建自定义代理技能的开发方法与工具链。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 设备端Tiny LLM优化
- AI Edge平台
- TensorFlow Lite
- MediaPipe
- Gemini Nano部署
- 系统级GenAI
- AI Core API
- 跨平台支持
- Android
- NPU/GPU
金句 / Highlights
值得收藏与分享的关键句。
TensorFlow Lite支持超过27亿设备,每日调用次数众多,许多Android应用已使用。
通过优化,小型LLM在设备端的推理性能从46%提升到90%。
Gemini 4模型在NPU/GPU上的部署实现了高效推理,适用于移动应用。
#Tiny LLMs#TensorFlow Lite#Gemini Nano#AI Edge#Google