Google Developers Blog

LiteRT.js, Google's high performance Web AI Inference

6.9内容质量

TL;DR · AI 摘要

LiteRT.js, Google's high performance Web AI Inference - Google Developers Blog Google Tag Manager noscript End Google Ta...

核心要点

  • 主题聚焦:LiteRT.js, Google's high performance Web AI Infe
  • 来源:Google Developers Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#前端#后端#云计算
打开原文

LiteRT.js,Google 的高性能网络 AI 推理 - Google 开发者博客

Google Tag Manager (noscript)

结束 Google Tag Manager (noscript)

HTML

LiteRT.js,Google 的高性能网络 AI 推理

2026 年 7 月 9 日

Ping Yu

软件工程师

Marko Ristić

Matthew Soulanille

Chintan Parikh

产品经理

分享

  • Facebook
  • Twitter
  • LinkedIn
  • 邮件

我们非常高兴地宣布 LiteRT.js,这是 LiteRT 的 JavaScript 绑定,可在网页浏览器中直接运行 AI。通过将值得信赖的设备端推理库 LiteRT 引入网络,网页开发者现在可以完全本地化地以最高性能运行 ML 和 AI 模型。这意味着增强的用户隐私、零服务器成本以及实时体验的超低延迟。对于已有 .tflite 模型的开发者,LiteRT.js 使将模型部署到移动和桌面网页浏览器变得前所未有的顺畅,成为从 TensorFlow.js 执行 .tflite 模型的强大演进。

虽然之前的网络 AI 解决方案如 TensorFlow.js 依赖于性能较低的 JavaScript 内核,我们现在通过 WebAssembly 向网页开发者直接提供我们原生的跨平台运行时及其所有优化。LiteRT.js 通过在浏览器中直接运行您的 .tflite 模型,利用 LiteRT 的尖端硬件加速(包括 CPU 的 XNNPACK、GPU 的 ML Drift 以及即将推出的 NPU 的 WebNN)实现令人印象深刻的性能。

我们的初始发布提供了所有必要的工具,包括新的 LiteRT.js npm 包和一系列展示实际应用的演示示例。

抱歉,您的浏览器不支持此视频的播放

通过 LiteRT.js 和 EmbeddingGemma 在浏览器中直接进行向量搜索。点击此处尝试。

LiteRT.js 为网页开发者带来的优势

借助 LiteRT.js,网页开发者可以将模型集成到使用 JavaScript 或 TypeScript 编写的应用程序中,完全在客户端处理文本生成、目标检测和音频处理等复杂任务。由于 LiteRT.js 与 LiteRT 共享统一的跨平台架构,您的网页应用会自动受益于专为 Android、iOS 和桌面平台开发的最新性能升级、量化改进和硬件优化。

通过利用 LiteRT 的降级流程和运行时,您可以轻松地将来自多种 Python 机器学习框架的模型转换为原生硬件加速支持的格式,覆盖所有主要加速器(CPU/GPU/NPU)。为了帮助您轻松解锁这些 AI 能力,以下是 LiteRT.js 的主要亮点:

  1. PyTorch 模型转换与定制量化

通过 LiteRT Torch,PyTorch 模型可以一步完成转换,使其能够立即利用先进的基于浏览器的硬件加速。按照 LiteRT Torch 指南立即开始使用。

为进一步优化,AI Edge Quantizer 允许您在不同模型层配置定制量化方案。这在保持整体模型质量的同时,实现了显著的体积缩减和性能提升。通过量化 Colab 示例查看实际效果。

  1. 跨 CPU、GPU 和 NPU 的原生硬件加速

LiteRT.js 为各种硬件后端提供高性能 AI 推理。

  • CPU:使用 XNNPACK,这是 Google 针对设备端 CPU 加速的高度优化库,提供强大的多线程支持和增强性能的放松 SIMD 构建。
  • GPU:由 ML Drift 提供支持,这是 Google 在设备端 GPU 加速方面的领先解决方案。LiteRT.js 借助 WebGPU 实现了网页端最先进的 GPU 加速能力。
  • NPU:利用新兴的 WebNN API(目前在 Chrome 和 Edge 浏览器中为实验性功能),针对专用 NPU 进行优化,实现高效能、超低延迟的推理。

准备好加速你的网页应用了吗?立即查阅 LiteRT.js 官方文档开始使用。

LiteRT.js 架构概览

性能与实际应用效果

为了验证统一运行时和硬件加速后端的实际效果,我们对 LiteRT.js 与现有网页解决方案进行了性能对比测试。在经典计算机视觉和音频处理模型上,LiteRT.js 显著提升了运行速度——在 CPU 和 GPU 推理任务中,性能表现优于其他网页运行时高达 3 倍。

注意:性能基准测试在 2024 款 Apple MacBook Pro(搭载 M4 芯片)上进行,测试环境为受控浏览器环境。实际用户性能可能因本地 GPU 性能、散热限制和浏览器驱动优化等因素而有所不同。

为了验证这些性能提升的实际效率价值,我们使用 LiteRT.js 对三个不同的网页执行后端进行了主流 AI 模型基准测试:CPU(通过 XNNPACK) 、WebGPU 和 WebNN(通过 Apple CoreML)。对于需要实时处理的高负载应用(如目标跟踪、音频转录或图像处理),通过 WebGPU 或 WebNN 调用 GPU/NPU 可实现相比标准 CPU 执行 5-60 倍的加速效果,在保证性能的同时显著降低延迟。

实际效果演示

要直观体验 LiteRT.js 的能力,可以查看我们的实时演示案例。LiteRT.js 演示源代码已发布在 LiteRT GitHub 仓库,并可通过 Ultralytics 获取。

LiteRT 与 Ultralytics YOLO 集成

Ultralytics 是一家专注于计算机视觉工具和模型开发的人工智能公司,最著名的是开发了 YOLO(You Only Look Once)框架——一系列实时目标检测和图像分割模型。

我们非常高兴地宣布,Ultralytics Python 包现已原生支持 LiteRT 导出功能。通过几行代码即可轻松部署 Ultralytics YOLO 模型到移动端、边缘设备和浏览器,实现从模型编译到运行时的无缝衔接。

演示案例:YOLO26 实时视觉模型系列

深度估计

Depth Anything 项目展示了如何通过单目深度估计技术,将普通网络摄像头画面实时转换为交互式 3D 点云。该演示通过 LiteRT.js 的 WebGPU 实现,使用 Depth-Anything-V2 模型即时计算深度数据,并将视频像素映射到响应式的 3D 空间。

演示案例:使用 DepthAnything 和 WebGPU 实现单目深度估计

图像超分辨率

通过 LiteRT.js 和 Real-ESRGAN 模型,可在浏览器中实现 4 倍图像超分辨率。该技术通过将 128x128 像素的图像块放大到 512x512 像素,再重新组合生成最终图像。

演示案例:将狗的图片上传至图像超分辨率网页,图片被放大至原始尺寸的 4 倍。图片来源

以下代码片段展示了使用 GPU 加速初始化、编译和运行 .tflite 模型的简化流程。通过现代简洁的 JavaScript,你可以加载模型、输入张量,并实时捕获高速推理结果。如需更详细的说明、演示和指导,请参考我们的文档。

code
import { loadLiteRt, loadAndCompile, Tensor } from '@litertjs/core';

await loadLiteRt('path/to/wasm/directory/');

const model = await loadAndCompile('path/to/your/model.tflite',{ accelerator: webgpu });

const inputTypedArray = new Float32Array(1 * 3 * 244 * 244);

const inputTensor = new Tensor(inputTypedArray, [1, 3, 244, 244]);

const results = await model.run(inputTensor);

// results 是存储在 GPU 上的 Tensor。要将其移动到 CPU 并转换为 typedArray,我们使用
const resultArray = (await results[0].moveTo('wasm')).toTypedArray();

JavaScript

复制代码

下一步计划

我们致力于持续提升 LiteRT.js 的性能、模型兼容性和开发者工具。未来的发展重点包括推进 WebNN 集成以实现原生 NPU 性能,以及为设备端生成式 AI 提供高度优化的支持。

  • 模型:在 Kaggle 或 LiteRT Hugging Face 社区查找预训练的 .tflite 模型。
  • 开始构建:查阅 LiteRT.js 文档。
  • 获取包:通过 npm 下载 @litertjs/core。
  • 贡献:在我们的 GitHub 问题页面提交反馈、报告错误或参与开发。
  • LLM 支持:LiteRT-LM.js 通过 JavaScript API 为浏览器提供 LLM 支持。
  • TensorFlow.js 用户:查看此处了解如何在现有 TensorFlow.js 管道中利用 LiteRT.js 进行模型推理。

致谢

感谢 Ultralytics 提供 YOLO26 的媒体和性能数据,感谢 Jason Mayes 提供 LiteRT.js 演示。

发布于:

  • Web
  • AI
  • 公告
  • 学习
  • 影响力
  • WebAI

上一篇

下一篇

相关文章

列表

AI

公告

学习

使用 Genkit 构建智能体全栈应用

2026年7月1日

移动

Web

案例研究

社区

通过 Antigravity 和 Gemini 构建的 AI 赛道教练:弥合领域差距

2026年7月8日

通过 Jules 测量重要指标

2026年6月22日

教程

我们在训练中途终止了一个 TPU,它在几秒钟内恢复了:MaxText 弹性训练简介

2026年7月6日

导航点