T
traeai
登录

概念

LLM

别名:大语言模型

具有复杂推理能力的生成式模型

已跟踪 30 条高相关材料

TraeAI 观察

相关材料

已收录 30 条与 LLM 相关的内容,按评分排序。

Enterprise Document Intelligence: A Series on Building RAG Brick by Brick, from Minimal to Corpus scale

企业文档智能:从最小到语料库规模逐砖构建RAG系列

Towards Data Science5486 字 (约 22 分钟)
92

企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。

入选理由:多数企业RAG部署效果不佳,因基础解析和检索质量差。

精选文章#RAG#企业AI#文档智能#检索增强生成#LLM应用英文
Andrew Ng(@AndrewYNg) 图标

Andrew Ng 提出编码智能体对四类软件工作加速程度差异显著:前端 > 后端 > 基础设施 > 研究,并强调团队架构需据此设定合理预期。

入选理由:前端开发因框架熟稔与浏览器闭环迭代能力,获最大加速;视觉设计短板不影响功能实现速度。

精选推文#AI Coding#Software Engineering#Team Architecture#LLM Applications中文
From Regex to Vision Models: Which RAG Technique Fits Which Problem

从正则到视觉模型:哪种 RAG 技术适合你的问题

Towards Data Science4997 字 (约 20 分钟)
90

RAG 技术并非万能,应根据文档结构和问题控制程度选择合适方法:模板化文档用正则表达式,客服对话需 LLM 判断语调,工程图纸必须使用视觉模型。

入选理由:模板化文档(如保险单、银行流水)适合用正则表达式提取字段,避免使用高成本的 RAG 流程。

精选文章#RAG#LLM#文档智能#视觉模型#企业AI英文
Your Enterprise Data Deserves Better Than a Chatbot

企业数据需要的远不止聊天机器人

Gradient Flow1417 字 (约 6 分钟)
87

企业数据治理不应依赖聊天机器人,关系型与时间序列数据正迎来专用基础模型的突破,KumoRFM-2在少标注下超越监督与通用基模,但高风险金融与医疗场景需谨慎验证与治理。

入选理由:KumoRFM-2仅用少量标注即可在多表关系数据上预测,超越监督基线与通用基模,显著降低数据科学管线复杂度。

精选文章#Kumo#KumoRFM-2#TabPFN#基础模型#关系型数据英文
Stop upgrading your LLM. Start fixing your data.

停止升级你的LLM,开始修复你的数据

Gradient Flow1389 字 (约 6 分钟)
87

企业部署AI智能体遇阻主因在数据整合质量而非模型能力升级,解决数据问题与组织流程重塑是成功关键。

入选理由:AI智能体部署失败中25%以上可归因于关键知识未实现系统化捕获与整理。

精选文章#AI智能体#企业AI#数据质量#系统集成#组织变革英文
Towards Data Science 图标

Proxy-Pointer RAG:解决大规模知识图谱中的实体与关系蔓延问题

Towards Data Science3847 字 (约 16 分钟)
87

Proxy-Pointer RAG 通过保留文档结构上下文,将知识图谱实体与关系匹配的计算成本降低 90% 以上,实现高效、低延迟的图谱入管,解决了大规模知识图谱的语义蔓延问题。

入选理由:Proxy-Pointer RAG 使用 Skeleton Tree 和 Breadcrumb Injection 技术,使向量检索能精准定位文档完整结构段,而非碎片化块。

精选文章#RAG#知识图谱#Proxy-Pointer#实体消歧#向量检索英文
// LLMs Improving LLMs //

Interesting progress the past of couple of weeks around self-improving AI...

// LLMs Improving LLMs //

elvis(@omarsar0)289 字 (约 2 分钟)
87

AutoTTS框架实现LLM自主搜索测试时扩展策略,仅用$39.9和160分钟即发现优于人工设计的控制器,在数学推理任务中达成更高精度-成本帕累托前沿。

入选理由:AutoTTS将测试时扩展策略搜索成本降至39.9美元和160分钟,显著低于传统人工调参。

精选推文#LLM#AutoTTS#AI代理#测试时扩展#arXiv论文英文
Stack Overflow Blog 图标

没有愚蠢的问题:什么是MCP服务器?为什么我关心它?

Stack Overflow Blog3096 字 (约 13 分钟)
87

MCP(模型上下文协议)由Anthropic于2024年12月提出,是统一AI与外部系统连接的标准化协议,显著降低集成复杂度。

入选理由:MCP由Anthropic在2024年12月提出,是用于标准化LLM与外部数据源连接的协议。

精选文章#MCP#LLM#API#Anthropic#AI集成英文
Red Hat AI 图标

How AI inference works, clearly explained

Red Hat AI2212 字 (约 9 分钟)
85

AI推理依赖模型权重、推理服务器和GPU协同工作,KV缓存优化可降低延迟和成本。

入选理由:推理服务器(如vLLM)是实现生产级GPU利用率的关键组件

精选文章#AI推理#LLM#KV缓存#优化#Red Hat英文
Red Hat AI 图标

企业级AI系统需构建包含计算、存储、服务和集成的四层架构,自托管与托管模式各有权衡。

入选理由:企业AI系统依赖四层基础设施:计算、模型存储、服务层和系统集成

精选文章#AI架构#企业系统#模型部署#Kubernetes英文
How to reduce LLM costs without sacrificing quality

How to reduce LLM costs without sacrificing quality

Arize AI Blog2205 字 (约 9 分钟)
85

通过追踪数据和验证优化,可在不牺牲质量的前提下降低LLM成本,关键策略包括连接支出与请求、验证优化效果、分析模型选择影响。

入选理由:使用追踪数据将成本与具体请求/模型调用关联,定位浪费环节

精选文章#LLM#成本优化#追踪#AI评估#大模型英文
Agent cost management is about more than the model

Agent cost management is about more than the model

Arize AI Blog1580 字 (约 7 分钟)
85

Arize AI推出成本控制代理,通过自动化分析和优化LLM调用,显著降低代理应用的运营成本。

入选理由:Arize AX的Cost Agent可自动识别并优化LLM调用中的高成本步骤

精选文章#LLM#成本优化#Arize AI#代理系统英文
Amazon Science 图标

When LLM judges agree, should we believe them?

Amazon Science1392 字 (约 6 分钟)
85

使用Ising模型进行依赖感知的标签聚合,可提升多评委LLM评估的准确性,减少因评委输出相关性导致的误差。

入选理由:Ising模型方法在三个任务中提升9-14%准确率,优于加权多数投票基线。

精选文章#LLM#Ising模型#多评委系统#标签聚合英文
Towards Data Science 图标

8 Tips for Writing Effective Agent Instructions

Towards Data Science1945 字 (约 8 分钟)
85

编写有效代理指令的8个技巧,涵盖流程图设计、明确目标、工具整合等关键点。

入选理由:使用流程图工具(如Mermaid.js)可视化业务流程可提升团队协作效率

精选文章#AI代理#指令工程#LLM#RAG#流程设计英文
KDnuggets 图标

Quantization and Pruning Methods to Make Your LLM Leaner

KDnuggets4604 字 (约 19 分钟)
85

量化和剪枝技术能显著减小LLM体积,降低部署成本,避免因模型过大导致的资源浪费和延迟。

入选理由:量化将16位浮点数转为4位整数,减少存储空间且加速计算

精选文章#LLM优化#量化#剪枝#模型压缩#AI部署英文
DeepLearning.AI(@DeepLearningAI) 图标

开发者需掌握LLM基础、数据 grounding、代理系统构建等技能以应对AI应用的不确定性。Andrew Ng提出AI工程需六大核心能力。

入选理由:AI工程需掌握LLM基础、数据 grounding、代理系统构建三大核心能力

精选推文#AI工程#机器学习#LLM#Andrew Ng中英混合
Prompt Caching Explained: Stop Overpaying for AI Agents

Prompt Caching Explained: Stop Overpaying for AI Agents

Hugging Face3347 字 (约 14 分钟)
85

正确实现Prompt Caching可避免AI代理重复计费,节省高达90%的上下文处理成本。

入选理由:缓存LLM输出无效,应缓存输入prompt以避免重复处理

精选视频#AI代理#Prompt Caching#LLM优化#成本控制英文
Agent Memory EXPLAINED - Complete Architecture

Agent Memory EXPLAINED - Complete Architecture

Hugging Face5445 字 (约 22 分钟)
85

Agent Memory系统通过Mem0架构实现跨会话记忆,结合向量数据库与关系型数据库构建长期记忆,支持检索、删除等操作。

入选理由:Mem0使用向量数据库+关系型数据库实现长期记忆存储

精选视频#Agent Memory#Mem0#LLM#向量数据库英文
Grok exfiltrates user data when malicious instructions are encrypted

Grok exfiltrates user data when malicious instructions are encrypted

Ars Technica1071 字 (约 5 分钟)
85

Grok模型存在安全漏洞,攻击者通过加密恶意指令绕过防护,导致用户数据泄露。该方法利用LLM无法区分加密内容与正常指令的弱点,对AI安全防护提出新挑战。

入选理由:加密恶意指令可绕过Grok安全防护,导致数据泄露。

精选文章#AI安全#LLM漏洞#数据泄露#Grok#加密攻击英文
Together AI Blog 图标

A/B test models in production

Together AI Blog1936 字 (约 8 分钟)
85

Together AI平台提供端点级A/B测试方案,通过动态流量分配验证LLM模型效果,避免传统方法的基础设施耦合问题。

入选理由:Together AI平台在端点层实现A/B测试,无需修改客户端代码

精选文章#A/B测试#LLM#生产环境#Together AI#技术实践英文
Interconnects AI 图标

I wrote an AI textbook — how long until AI can do it better?

Interconnects AI2657 字 (约 11 分钟)
85

AI在非虚构写作和复杂科学问题上仍需人类引导,当前模型在组织知识和解决开放性问题上存在局限。

入选理由:当前LLM在非虚构写作中难以有效组织知识,影响科学问题解决。

精选文章#AI#LLM#科学写作#自然语言处理英文
Every serious TTS ships emotion tags like [whispering] [laugh] [excited]. Almost nobody uses them - ...

Fish Audio推出Expressive模式,通过LLM内联生成情感标签并由S2.1 Pro渲染,使语音代理能自然表达情绪,LiveKit Agents一键启用该功能。

入选理由:TTS系统普遍支持但未有效利用情感标签,用户偏好自然情绪表达

精选推文#TTS#语音合成#LLM#LiveKit#情感计算中英混合
Towards Data Science 图标

A Day in the Life of a Data Scientist in 2026

Towards Data Science1164 字 (约 5 分钟)
85

AI显著改变了数据科学家的日常工作,提示工程成为核心技能,LLM成本控制成为关键挑战。

入选理由:精确设计提示词可使LLM输出质量提升数倍,需包含具体指标和约束条件。

精选文章#数据科学#AI#提示工程#LLM英文
KDnuggets 图标

Constraining Output Space for SLM Narrow Automation Optimization

KDnuggets2358 字 (约 10 分钟)
85

限制输出空间可使小型语言模型在窄自动化任务中效率提升8倍,成本降低千倍,适合工业级高并发场景。

入选理由:分类任务固定输出空间可使推理速度提升8倍

精选文章#Small Language Models#Automation Optimization#NLP#Efficiency英文
Machine Learning Mastery 图标

Prompt Caching vs. Fine-Tuning: A Cost and Latency Decision Framework

Machine Learning Mastery1386 字 (约 6 分钟)
85

提示缓存和微调是优化代理AI系统成本与延迟的两种策略,文章提供决策框架帮助选择合适方案。

入选理由:提示缓存可使重复请求计算成本降至零,但需额外存储开销

精选文章#LLM#AI优化#微调#缓存策略英文
llm-gemini 0.33

llm-gemini 0.33

Simon Willison's Weblog385 字 (约 2 分钟)
85

llm-gemini 0.33版本新增对Gemini 3.7 Flash等模型的支持,并兼容LLM 0.32的推理轨迹功能。

入选理由:33版本新增gemini-3.7-flash等4个模型支持

精选文章#LLM#Gemini#插件#技术更新英文

跨材料问答 · LLM

回答基于:LLM 相关 30 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容