← All writing

基于生成的大语言模型(LLM)评估:从生成到判断的机遇与挑战

人工智能(AI)和自然语言处理(NLP)的评估任务长期以来一直具有挑战性。传统的评估方法,例如基于匹配或嵌入的评估方法,在评估…

Read the English edition →

基于生成的大型语言模型(LLM)的评估:从生成到判断的机遇和挑战

摘要

人工智能(AI)和自然语言处理(NLP)的评估任务长期以来一直具有挑战性。传统的评估方法,例如基于匹配或嵌入的评估方法,在评估复杂属性方面受到限制。最近大型语言模型 (LLM) 的发展催生了“LLM 作为法官”范式,该范式利用 LLM 进行评分、排名或选择任务。本文对法学硕士评估方法进行了全面回顾,包括其定义、分类框架、基准和未来研究方向。


一、简介

1.1 背景

评估是机器学习和自然语言处理的核心问题之一。 BLEU、ROUGE等传统评估方法往往依赖于文本重叠,在复杂场景下缺乏适用性。随着深度学习和LLM(例如GPT-4)的发展,研究人员提出了“LLM作为法官”范式来解决传统评估方法的局限性。

1.2 研究问题

本文旨在探讨以下问题:

  • LLM 评估什么?
  • 评估是如何进行的?
  • LLM在哪里申请评估?

2. 预备知识

2.1 输入格式

评估输入可分为以下几类:

  • 逐点:单个样品的评估。
  • 配对/列表方式:多个样品的比较评价。

2.2 输出格式

评估输出包括:

  • 分数:样品的定量评分。
  • 排名: 根据优点排序。
  • 选择:在候选者中选择最佳选项。

3. 评价属性

3.1 帮助

法学硕士通过指导用户任务和生成反馈来评估响应的有用性,这对于人工智能协调至关重要。

3.2 无害性

评估文本的无害性是生成安全内容的关键。法学硕士协助数据标记或直接评估潜在的有害内容。

3.3 可靠性

法学硕士检测事实的准确性和一致性,例如,生成支持证据或进行对话级别的可靠性评估。

3.4 相关性

法学硕士评估生成或检索内容的相关性,适用于对话和检索增强生成(RAG)等场景。

3.5 可行性

在复杂的任务中,法学硕士会判断候选步骤或行动的可行性,以优化决策路径。

3.6 综合素质

法学硕士通过多维度打分,提供整体评价,适合生成任务中的综合比较。


4. 方法论

概述

方法论部分侧重于通过两种方法优化法学硕士作为评估者(LLM-as-a-Judge)的能力:微调和即时工程。

  1. 微调技术:使用监督微调(SFT)和带有标记或综合反馈的偏好学习来增强LLM判断能力。
  2. 及时工程:设计有效的提示策略,如操作交换、规则增强、多智能体协作等,以提高推理和评估的准确性和可靠性。

4.1 微调技术

数据来源
1. 人类标记数据

人类标记的数据提供了高质量的训练样本,帮助法学硕士了解人类的偏好。主要研究和创新包括:

  1. 熊猫LM [Wang et al., 2024h]:

    • 收集了包含 300,000 个样本的多样化数据集,用于指令生成任务。
    • 通过集成开放域 QA 和对话生成等数据源来增强泛化能力。
    • 引入标准化注释工作流程以实现一致性并强调多语言支持。
  2. 方面指令 [Liu et al., 2024a]:

    • 推出多维度评估定制数据集,涵盖65个任务、27个评估维度。
    • 设计了独特的任务分割机制,用于上下文理解和维度优先级排序。
2. 综合数据

法学硕士生成的合成数据减少了对人工标记的依赖并扩大了数据覆盖范围。主要研究和创新包括:

  1. 法官LM [Zhu et al., 2023]:

    • 生成了包含 100,000 个样本的数据集,涵盖各种指令生成场景。
    • 引入任务播种方法以确保多样性和特异性。
  2. 元奖励 [Wu et al., 2024]:

    • 提出“元奖励”,利用法学硕士自我评估信号来提高培训效果。
微调方法
1. 监督微调 (SFT)

SFT 使用人工标记或合成数据来培训法学硕士,以学习评估标准。主要研究包括:

  1. 火焰 [Vu et al., 2024]:

    • 利用具有 500 万个样本的多任务学习框架进行多任务 SFT。
    • 跨不同任务的统一评估标准。
  2. JSFT [Lee et al., 2024]:

    • 将 SFT 与偏好学习相结合,以优化不同评估任务的性能。
2. 偏好学习

偏好学习优化了复杂评估的法学硕士比较和排名能力。主要研究包括:

  1. HALU-J [Wang et al., 2024a]:

    • 采用具有多证据选择机制的定向偏好优化(DPO)。
  2. 自学成才的评估者 [Wang et al., 2024f]:

    • 使用自我生成的次优响应作为动态改进的负样本。

5. 应用

概述

法学硕士作为法官的应用已经从生成评估扩展到对齐、检索和推理。本节系统地介绍了这些应用、它们的具体任务和代表性研究。


5.1 评价

概述

法官法学硕士最初应用于对话生成和摘要等评估任务。主要研究包括:

  1. MD-法官 [Li et al., 2024f]:

    • 评估与安全相关的问答框架,重点关注危害性和道德风险。
  2. 陈框架 [Chan et al., 2023]:

    • 引入了多主体辩论框架以提高评估质量。
  3. ICE [Jain et al., 2023b]:

    • 使用少量示例进行交互式多维评估。

7. 挑战和未来方向

概述

尽管LLM作为法官的能力强大,但仍面临评估偏差、对动态任务的适应性以及人类与人工智能协作评估的潜力等挑战。本节探讨这些挑战并概述未来的研究方向。

7.1 偏见和漏洞
  1. 偏移偏差 [Park et al., 2024]:
    • 提出了一个去偏见框架,以减轻位置和内容偏见。
7.2 动态和复杂的评估
  1. 思想树 (ToT) [Yao et al., 2023a]:
    • 通过动态状态评估机制增强多步推理。
7.3 自我评估和人机协作
  1. 自学成才的评估者 [Wang et al., 2024f]:

    • 强调了模型通过自学习机制改进的潜力。
  2. 元奖励 [Wu et al., 2024]:

    • 展示了将自我评估信号整合到优化中的优势。