NVIDIA AI Blog

Reaching Across the Isles: UK-LLM Brings AI to UK Languages With NVIDIA Nemotron

8.5内容质量
Reaching Across the Isles: UK-LLM Brings AI to UK Languages With NVIDIA Nemotron

TL;DR · AI 摘要

英国政府与NVIDIA合作开发的UK-LLM项目利用Nemotron技术,为威尔士语等英国语言提供AI推理能力,支持公共服务多语言化。

核心要点

  • NVIDIA Nemotron技术使AI能同时处理英语和威尔士语,覆盖85万使用者。
  • Nscale通过API开放模型,开发者可构建双语聊天机器人等应用。
  • 项目目标2050年实现威尔士语百万使用者,推动Cymraeg 2050计划。

结构提纲

按章节快速跳转。

  1. 介绍UK-LLM项目通过NVIDIA技术实现威尔士语AI推理的背景与目标。

  2. 基于NVIDIA Nemotron开源技术和Isambard-AI超算训练模型。

  3. 支持医疗、教育等公共服务的威尔士语内容生成与翻译。

  4. 英国首相Keir Starmer支持,Nscale提供API接口。

  5. 扩展至康沃尔语、爱尔兰语等其他英国语言。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • UK-LLM项目
    • 技术基础
      • NVIDIA Nemotron模型
      • Isambard-AI超算
    • 应用场景
      • 医疗资源
      • 教育内容
      • 法律文件
    • 合作方
      • NVIDIA
      • UCL
      • Bangor University

金句 / Highlights

值得收藏与分享的关键句。

#NVIDIA Nemotron#AI模型#UK-LLM#威尔士语#公共服务
打开原文

通过 NVIDIA Nemotron 将 AI 带入英国语言 | NVIDIA 博客

标题

跨越海峡:UK-LLM 项目借助 NVIDIA Nemotron 为英国语言带来 AI

基于 Isambard-AI 超级计算机训练,由伦敦大学学院、NVIDIA 和班戈大学联合开发的新模型,利用 NVIDIA Nemotron 开源技术和数据集,为威尔士语及其他英国语言在医疗、教育和法律等公共服务领域实现 AI 推理能力。

2025年9月13日

作者

Kari Briski

/inner3

META

0条评论

分享

分享本文

  • X
  • Facebook
  • LinkedIn
  • 复制链接 链接已复制!

特色图片/视频

凯尔特语系——包括康沃尔语、爱尔兰语、苏格兰盖尔语和威尔士语——是英国最古老的活语言。为增强这些语言使用者的能力,英国主权 AI 计划 UK-LLM 正在基于 NVIDIA Nemotron 构建一个 AI 模型,该模型能够同时用英语和威尔士语进行推理,后者目前在威尔士有约 85 万人使用。

在威尔士语中实现高质量 AI 推理能力,将支持医疗、教育和法律等公共服务以该语言提供。

“我希望英国每个角落都能利用人工智能的优势。通过让 AI 在威尔士语中进行推理,我们确保从医疗到教育的公共服务对所有人开放,使用他们日常生活的语言,”英国首相基尔·斯塔默表示。“这是最新 AI 技术如何通过英国最先进的 AI 超级计算机(位于布里斯托尔)为公共利益服务、保护文化遗产并在全国范围内创造机会的有力例证。”

UK-LLM 项目于 2023 年作为 BritLLM 启动,由伦敦大学学院主导,此前已发布了两个英国语言模型。其最新威尔士语模型由威尔士班戈大学和 NVIDIA 联合开发,与威尔士政府提升该语言活跃使用的努力相一致,目标是到 2050 年实现 100 万使用者——这一计划被称为 Cymraeg 2050

英国 AI 云服务提供商 Nscale 将通过其应用程序编程接口向开发者提供该新模型。

“我们的目标是确保威尔士语保持一种充满活力、与时俱进的语言,”Canolfan Bedwyr 大学威尔士语言服务、研究和技术中心的高级术语学家兼语言技术部门主管 Gruffudd Prys 表示。“AI 在帮助学习者掌握威尔士语第二语言以及帮助母语者提升语言技能方面展现出巨大潜力。”

该新模型还可通过使公共机构和威尔士运营的企业能够翻译内容或提供双语聊天机器人服务,提升威尔士语资源的可访问性。这有助于医疗提供者、教育者、广播公司、零售商和餐馆老板等群体确保其书面内容在威尔士语中的可用性与英语相当。

除了威尔士语,UK-LLM 团队还计划将新模型所采用的方法应用于开发其他英国语言的 AI 模型,如康沃尔语、爱尔兰语、苏格兰语和苏格兰盖尔语,并与国际合作伙伴合作,为非洲和东南亚的语言构建模型。

“与NVIDIA和班戈大学的合作使我们能够在创纪录的时间内创建新的训练数据并训练新模型,加速了我们构建最佳威尔士语语言模型的目标,”伦敦大学学院自然语言处理教授、人工智能中心副主任Pontus Stenetorp表示。“我们的目标是将从威尔士语模型中获得的见解应用于其他少数民族语言,不仅在英国,也在全球范围内。”

利用主权AI基础设施进行模型开发

新的威尔士语模型基于NVIDIA Nemotron,这是一个包含开放权重、数据集和训练方案的开源模型系列。UK-LLM开发团队采用了490亿参数的Llama Nemotron超级模型和90亿参数的Nemotron Nano模型,并在威尔士语数据上进行后训练。

与英语或西班牙语等语言相比,威尔士语用于AI训练的可用源数据较少。因此,为了创建足够大的威尔士语训练数据集,团队使用NVIDIA NIM微服务对gpt-oss-120b和DeepSeek-R1进行翻译,将NVIDIA Nemotron开放数据集中的3000多万条英文内容翻译为威尔士语。

他们通过NVIDIA DGX Cloud Lepton平台使用GPU集群,并利用位于布里斯托尔大学的Isambard-AI超级计算机上的数百块NVIDIA GH200 Grace Hopper Superchip加速翻译和训练任务。这台超级计算机是英国最强大的超级计算机,获得了2.25亿英镑的政府投资。

这个新数据集补充了团队之前努力收集的现有威尔士语数据。

通过细致评估捕捉语言细微差别

位于威尔士语使用者比例最高的郡——格温内德的班戈大学,正在利用其语言和文化专业知识支持新模型的开发。

威尔士语翻译:“我们的目标是确保威尔士语保持一种充满活力、与时俱进的语言。”——班戈大学Gruffudd Prys

来自大学威尔士语中心的Prys为此次合作带来了二十多年威尔士语语言技术的经验。他和团队正在帮助验证机器翻译训练数据的准确性以及人工翻译评估数据的准确性,并评估模型如何处理AI通常难以应对的威尔士语细微差别——例如威尔士语单词开头辅音会根据相邻单词发生变化的规则。

该模型以及威尔士语训练和评估数据集预计将向企业和公共部门开放,支持进一步的研究、模型训练和应用开发。

“让这种AI能力存在于威尔士语中是一回事,但让其对所有人开放和可访问则是另一回事,”Prys表示。“这种微妙的区别可能决定这项技术是否会被使用。”

使用NVIDIA Nemotron和NIM微服务部署主权AI模型

用于开发UK-LLM威尔士语模型的框架可作为全球多语言AI开发的基础。

在推理模型方面表现优异的Nemotron模型、数据和训练方案已向开发者公开,可用于构建针对几乎所有语言、领域和工作流程的定制模型。作为NVIDIA NIM微服务打包的Nemotron模型,经过优化以实现成本效益高的计算,并可在从笔记本电脑到云端的任何地方运行。

跨越岛屿:DU-LLM 与 NVIDIA Nemotron 为英国语言带来人工智能

该模型由伦敦大学学院、NVIDIA 和班戈大学联合开发,基于 Isambard-AI 超级计算机进行训练,利用 NVIDIA Nemotron 的开源数据集和人工智能技术,使人工智能推理能力可应用于威尔士语及其他英国语言,从而为包括医疗保健、教育和法律资源在内的公共服务提供支持。

威尔士语、康沃尔语、爱尔兰语和苏格兰盖尔语是英国最古老的活语言。为了更好地服务这些语言的使用者,英国人工智能主权机构 DU-LLM 基于 NVIDIA Nemotron 构建了人工智能模型,该模型不仅支持英语推理,还能支持威尔士语推理,目前威尔士语使用者约有 850,000 人。

在威尔士语中实现高性能人工智能推理能力将有助于提供包括医疗保健、教育和法律资源在内的公共服务。

英国首相基尔·斯塔默表示:“我希望英国的每一个人都能利用人工智能的优势。通过让人工智能支持威尔士语推理,我们确保公共服务——从医疗保健到教育——对所有人开放,使用他们生活的语言。”“这体现了最前沿的人工智能技术如何在英国最先进的人工智能超级计算机上进行训练,为公众福祉、保护文化遗产和释放国家机会提供服务。”

DU-LLM 项目于 2023 年以 BritLLM 的名义成立,由伦敦大学学院领导。该项目已发布了两个用于英国语言的模型。其最新的威尔士语模型由伦敦大学学院、威尔士班戈大学和 NVIDIA 联合开发,与威尔士政府推动语言实际使用率的举措同步进行,目标是到 2050 年实现 100 万威尔士语使用者——即“2050 威尔士语”计划。

英国人工智能供应商 Nscale 将通过其编程接口(API)向开发者提供新模型。

伦敦大学学院贝德福德中心语言技术单位负责人格里夫·普里斯表示:“我们的目标是确保威尔士语继续作为一门活语言存在,不断发展。”“人工智能展示了巨大的潜力,不仅可以帮助威尔士语作为第二语言的复兴,还能帮助母语使用者提升语言技能。”

该新模型还可以通过使公共机构和在威尔士运营的企业能够翻译内容或提供双语聊天服务,提高威尔士语资源的可访问性。这将帮助包括医疗保健提供者、教育工作者、出版商、零售商和餐饮业者在内的群体,确保其书面内容在威尔士语中与英语一样易于获取。

与威尔士语(Cymraeg)相关,英国-LLM(UK-LLM)团队正致力于将用于其新模型的相同方法论应用于开发其他语言的AI模型,包括威尔士语、康沃尔语(Cernyweg)、威尔士语(Gwyddeleg)、苏格兰盖尔语(Sgoteg)和苏格兰盖尔语(Gaeleg yr Alban)等在英国广泛使用的语言,同时与国际合作伙伴合作,为非洲和东南亚的语言构建模型。

“与NVIDIA和班戈大学的合作使我们能够创建新的训练数据,并在创纪录的时间内训练出新模型,从而加速我们为威尔士语构建历史上最佳语言模型的目标,”伦敦大学学院(University College London)人工智能研究中心(Artificial Intelligence Centre)的自然语言处理教授兼副主任Pontus Stenetorp表示。“我们的目标是将从威尔士语模型中学到的经验应用于其他语言,包括英国及全球其他语言。”

基于开源人工智能基础构建模型开发

新的威尔士语模型基于NVIDIA Nemotron,这是一套包含权重、数据集和开源代码的开源模型家族。UK-LLM开发团队利用了拥有490亿参数的Llama Nemotron Super模型和拥有90亿参数的Nemotron Nano模型,并在这些模型上进行了威尔士语数据的训练。

与英语或西班牙语等语言相比,威尔士语在人工智能训练方面可用的开源数据较少。因此,为了创建足够大的威尔士语训练数据集,团队使用了NVIDIA NIM微服务,将NVIDIA的开源数据集(包含超过3000万条英文记录)通过gpt-oss-120b和DeepSeek-R1模型翻译成威尔士语。

他们通过NVIDIA DGX Cloud Lepton平台使用GPU集群,并利用数百个NVIDIA GH200 Grace Hopper GPU(在Isambard-AI上运行)——这是英国最强大的超级计算机,由政府提供2.25亿英镑资金,并部署在布里斯托大学(University of Bristol)——来加速翻译和训练工作。

这个新数据集覆盖了团队之前研究中使用的威尔士语数据。

通过有偏见的自然语言获取洞察

位于威尔士北部的班戈大学(University of Bangor)——该地区拥有威尔士语使用者比例最高的县——正在利用其语言和文化专长支持新模型的开发。

来自班戈大学威尔士语中心的Prys拥有超过二十年的威尔士语自然语言处理技术经验,参与此次合作。他和他的团队正在验证由机器翻译和人工翻译生成的训练数据准确性,并评估模型如何处理人工智能通常会遇到的威尔士语独特之处,例如威尔士语单词在开头时如何根据相邻单词的发音发生变化。

预计该模型以及威尔士语的训练和评估数据集将向公众和学术界开放,支持进一步的研究、模型训练和软件开发。

“让人工智能在威尔士语中存在是一回事,但让它对所有人开放和可用则是另一回事,”Prys表示。“这种能力的差异可能就是这项技术被使用或不被使用的分水岭。”

使用NVIDIA Nemotron和NIM微服务进行人工智能模型开发

用于开发威尔士语 DU-LLM 模型的框架将成为全球多语言人工智能开发的基石。

Nemotron 模型、数据集和推理能力现已向开发者开放,使其能够构建几乎适用于任何语言、领域和工作负载的推理模型。作为 NVIDIA NIM 微服务的一部分,Nemotron 模型已针对高效能计算和任意环境下的运行进行了优化,从云端到边缘设备均可部署。

欧洲的算力中心将能够运行开源模型,这些模型基于由人工智能驱动的 Perplexity 搜索引擎进行训练。

立即了解 NVIDIA Nemotron。

#secondary

  • 分类:
  • 人工智能
  • 深度学习
  • 标签:
  • 人工智能向善
  • 人工智能
  • 教育
  • NVIDIA NIM
  • 主权人工智能
  • 合成数据生成

相关新闻

人工智能基础设施

NVIDIA Vera Rubin 实现每瓦特最高性能,为全球合作伙伴提供最低的 Token 成本

2026年7月21日

超级计算

Bristol Myers Squibb 在 NVIDIA Vera Rubin 上构建生命科学行业最先进的 AI 工厂

2026年7月20日

NVIDIA 与日本将全栈人工智能和机器人技术带入每个行业

2026年7月15日

为什么每瓦特性能是衡量人工智能基础设施效率的终极指标

2026年7月14日