T
traeai
登录

概念

LLM-as-a-Judge

别名:LLM评估系统

基于大模型的自动化评估框架

已跟踪 7 条高相关材料

TraeAI 观察

相关材料

已收录 7 条与 LLM-as-a-Judge 相关的内容,按评分排序。

How to Evaluate AI Agents with an LLM-as-a-Judge Harness in Python

How to Evaluate AI Agents with an LLM-as-a-Judge Harness in Python

freeCodeCamp.org2416 字 (约 10 分钟)
85

本文提供本地化AI代理评估框架,结合LLM作为裁判与规则检查,使用LangChain、Ollama等工具实现零API成本测试。

入选理由:使用LLM-as-a-judge与规则检查双重机制评估AI代理输出

精选文章#AI评估#LLM#Python#LangChain#Ollama英文
Databricks 图标

AI-Enabled Advisory Services for Higher Education

Databricks1365 字 (约 6 分钟)
85

Databricks通过GenAI和LLM技术解决高校咨询电话质量评估难题,实现规模化转录、评分与洞察提取。

入选理由:使用OpenAI Whisper等基础模型可提升电话转录准确率60%以上

精选文章#AI#高等教育#Databricks#GenAI#LLM英文
Machine Learning Mastery 图标

LLM Evaluation Frameworks Compared: How to Actually Measure What Your Model Does

Machine Learning Mastery4572 字 (约 19 分钟)
85

LLM评估框架存在可测量偏差,RAGAS/DeepEval/Promptfoo各有适用场景,需结合生产监控工具实现完整评估体系。

入选理由:RAGAS/DeepEval/Promptfoo三框架分别适用于不同评估场景,成熟团队常并行使用

精选文章#LLM#评估框架#RAGAS#DeepEval#Promptfoo英文
Presentation: Powering the Future: Building Your GenAI Infrastructure Stack

演讲:驱动未来:构建你的GenAI基础设施栈

InfoQ7951 字 (约 32 分钟)
82

Intuit通过GenOS平台和"固定-灵活-自由"框架支撑8000多名开发者完成3500多个生产实验,实现AI Agent规模化落地,关键实践包括LLM-as-a-judge评估策略和面向Agent的API设计原则。

入选理由:Intuit采用"fixed, flexible, free"三层框架设计GenOS平台,fixed层提供标准化基础设施,flexible层支持业务定制,free层鼓励创新实验

精选文章#AI Agent#GenAI基础设施#Intuit#LLM评估#平台工程英文

跨材料问答 · LLM-as-a-Judge

回答基于:LLM-as-a-Judge 相关 7 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容