LiteRT.js, Google's high performance Web AI Inference
TL;DR · AI 摘要
LiteRT.js, Google's high performance Web AI Inference - Google Developers Blog Google Tag Manager noscript End Google Ta...
核心要点
- 主题聚焦:LiteRT.js, Google's high performance Web AI Infe
- 来源:Google Developers Blog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
LiteRT.js,Google 的高性能网络 AI 推理 - Google 开发者博客
Google Tag Manager (noscript)
结束 Google Tag Manager (noscript)
HTML
LiteRT.js,Google 的高性能网络 AI 推理
2026 年 7 月 9 日
Ping Yu
软件工程师
Marko Ristić
Matthew Soulanille
Chintan Parikh
产品经理
分享
- 邮件
我们非常高兴地宣布 LiteRT.js,这是 LiteRT 的 JavaScript 绑定,可在网页浏览器中直接运行 AI。通过将值得信赖的设备端推理库 LiteRT 引入网络,网页开发者现在可以完全本地化地以最高性能运行 ML 和 AI 模型。这意味着增强的用户隐私、零服务器成本以及实时体验的超低延迟。对于已有 .tflite 模型的开发者,LiteRT.js 使将模型部署到移动和桌面网页浏览器变得前所未有的顺畅,成为从 TensorFlow.js 执行 .tflite 模型的强大演进。
虽然之前的网络 AI 解决方案如 TensorFlow.js 依赖于性能较低的 JavaScript 内核,我们现在通过 WebAssembly 向网页开发者直接提供我们原生的跨平台运行时及其所有优化。LiteRT.js 通过在浏览器中直接运行您的 .tflite 模型,利用 LiteRT 的尖端硬件加速(包括 CPU 的 XNNPACK、GPU 的 ML Drift 以及即将推出的 NPU 的 WebNN)实现令人印象深刻的性能。
我们的初始发布提供了所有必要的工具,包括新的 LiteRT.js npm 包和一系列展示实际应用的演示示例。
抱歉,您的浏览器不支持此视频的播放
通过 LiteRT.js 和 EmbeddingGemma 在浏览器中直接进行向量搜索。点击此处尝试。
LiteRT.js 为网页开发者带来的优势
借助 LiteRT.js,网页开发者可以将模型集成到使用 JavaScript 或 TypeScript 编写的应用程序中,完全在客户端处理文本生成、目标检测和音频处理等复杂任务。由于 LiteRT.js 与 LiteRT 共享统一的跨平台架构,您的网页应用会自动受益于专为 Android、iOS 和桌面平台开发的最新性能升级、量化改进和硬件优化。
通过利用 LiteRT 的降级流程和运行时,您可以轻松地将来自多种 Python 机器学习框架的模型转换为原生硬件加速支持的格式,覆盖所有主要加速器(CPU/GPU/NPU)。为了帮助您轻松解锁这些 AI 能力,以下是 LiteRT.js 的主要亮点:
- PyTorch 模型转换与定制量化
通过 LiteRT Torch,PyTorch 模型可以一步完成转换,使其能够立即利用先进的基于浏览器的硬件加速。按照 LiteRT Torch 指南立即开始使用。
为进一步优化,AI Edge Quantizer 允许您在不同模型层配置定制量化方案。这在保持整体模型质量的同时,实现了显著的体积缩减和性能提升。通过量化 Colab 示例查看实际效果。
- 跨 CPU、GPU 和 NPU 的原生硬件加速
LiteRT.js 为各种硬件后端提供高性能 AI 推理。
- CPU:使用 XNNPACK,这是 Google 针对设备端 CPU 加速的高度优化库,提供强大的多线程支持和增强性能的放松 SIMD 构建。
- GPU:由 ML Drift 提供支持,这是 Google 在设备端 GPU 加速方面的领先解决方案。LiteRT.js 借助 WebGPU 实现了网页端最先进的 GPU 加速能力。
- NPU:利用新兴的 WebNN API(目前在 Chrome 和 Edge 浏览器中为实验性功能),针对专用 NPU 进行优化,实现高效能、超低延迟的推理。
准备好加速你的网页应用了吗?立即查阅 LiteRT.js 官方文档开始使用。
LiteRT.js 架构概览
性能与实际应用效果
为了验证统一运行时和硬件加速后端的实际效果,我们对 LiteRT.js 与现有网页解决方案进行了性能对比测试。在经典计算机视觉和音频处理模型上,LiteRT.js 显著提升了运行速度——在 CPU 和 GPU 推理任务中,性能表现优于其他网页运行时高达 3 倍。
注意:性能基准测试在 2024 款 Apple MacBook Pro(搭载 M4 芯片)上进行,测试环境为受控浏览器环境。实际用户性能可能因本地 GPU 性能、散热限制和浏览器驱动优化等因素而有所不同。
为了验证这些性能提升的实际效率价值,我们使用 LiteRT.js 对三个不同的网页执行后端进行了主流 AI 模型基准测试:CPU(通过 XNNPACK) 、WebGPU 和 WebNN(通过 Apple CoreML)。对于需要实时处理的高负载应用(如目标跟踪、音频转录或图像处理),通过 WebGPU 或 WebNN 调用 GPU/NPU 可实现相比标准 CPU 执行 5-60 倍的加速效果,在保证性能的同时显著降低延迟。
实际效果演示
要直观体验 LiteRT.js 的能力,可以查看我们的实时演示案例。LiteRT.js 演示源代码已发布在 LiteRT GitHub 仓库,并可通过 Ultralytics 获取。
LiteRT 与 Ultralytics YOLO 集成
Ultralytics 是一家专注于计算机视觉工具和模型开发的人工智能公司,最著名的是开发了 YOLO(You Only Look Once)框架——一系列实时目标检测和图像分割模型。
我们非常高兴地宣布,Ultralytics Python 包现已原生支持 LiteRT 导出功能。通过几行代码即可轻松部署 Ultralytics YOLO 模型到移动端、边缘设备和浏览器,实现从模型编译到运行时的无缝衔接。
演示案例:YOLO26 实时视觉模型系列
深度估计
Depth Anything 项目展示了如何通过单目深度估计技术,将普通网络摄像头画面实时转换为交互式 3D 点云。该演示通过 LiteRT.js 的 WebGPU 实现,使用 Depth-Anything-V2 模型即时计算深度数据,并将视频像素映射到响应式的 3D 空间。
演示案例:使用 DepthAnything 和 WebGPU 实现单目深度估计
图像超分辨率
通过 LiteRT.js 和 Real-ESRGAN 模型,可在浏览器中实现 4 倍图像超分辨率。该技术通过将 128x128 像素的图像块放大到 512x512 像素,再重新组合生成最终图像。
演示案例:将狗的图片上传至图像超分辨率网页,图片被放大至原始尺寸的 4 倍。图片来源
以下代码片段展示了使用 GPU 加速初始化、编译和运行 .tflite 模型的简化流程。通过现代简洁的 JavaScript,你可以加载模型、输入张量,并实时捕获高速推理结果。如需更详细的说明、演示和指导,请参考我们的文档。
import { loadLiteRt, loadAndCompile, Tensor } from '@litertjs/core';
await loadLiteRt('path/to/wasm/directory/');
const model = await loadAndCompile('path/to/your/model.tflite',{ accelerator: webgpu });
const inputTypedArray = new Float32Array(1 * 3 * 244 * 244);
const inputTensor = new Tensor(inputTypedArray, [1, 3, 244, 244]);
const results = await model.run(inputTensor);
// results 是存储在 GPU 上的 Tensor。要将其移动到 CPU 并转换为 typedArray,我们使用
const resultArray = (await results[0].moveTo('wasm')).toTypedArray();JavaScript
复制代码
下一步计划
我们致力于持续提升 LiteRT.js 的性能、模型兼容性和开发者工具。未来的发展重点包括推进 WebNN 集成以实现原生 NPU 性能,以及为设备端生成式 AI 提供高度优化的支持。
- 模型:在 Kaggle 或 LiteRT Hugging Face 社区查找预训练的 .tflite 模型。
- 开始构建:查阅 LiteRT.js 文档。
- 获取包:通过 npm 下载 @litertjs/core。
- 贡献:在我们的 GitHub 问题页面提交反馈、报告错误或参与开发。
- LLM 支持:LiteRT-LM.js 通过 JavaScript API 为浏览器提供 LLM 支持。
- TensorFlow.js 用户:查看此处了解如何在现有 TensorFlow.js 管道中利用 LiteRT.js 进行模型推理。
致谢
感谢 Ultralytics 提供 YOLO26 的媒体和性能数据,感谢 Jason Mayes 提供 LiteRT.js 演示。
发布于:
- Web
- AI
- 公告
- 学习
- 影响力
- WebAI
上一篇
下一篇
相关文章
列表
AI
公告
学习
使用 Genkit 构建智能体全栈应用
2026年7月1日
移动
Web
案例研究
社区
通过 Antigravity 和 Gemini 构建的 AI 赛道教练:弥合领域差距
2026年7月8日
通过 Jules 测量重要指标
2026年6月22日
云
教程
我们在训练中途终止了一个 TPU,它在几秒钟内恢复了:MaxText 弹性训练简介
2026年7月6日
导航点