教程官方文档2 分钟阅读教程/部署

指导用户使用FastGPT应用评测功能进行应用效果定量评估

FastGPT v4.11.0及以上版本支持应用批量评测功能,该功能可通过传入多组问答对自动对应用执行结果打分,实现应用运行效果的定量评估。当前测试版仅支持回答准确性这一项评估指标,其余指标将在后续版本中补充完善。 1. 进入评测页面:打开工作台下的应用评测目录,点击右上角的「创建任务」按钮。 2.

FastGPT v4.11.0及以上版本支持应用批量评测功能,该功能可通过传入多组问答对自动对应用执行结果打分,实现应用运行效果的定量评估。当前测试版仅支持回答准确性这一项评估指标,其余指标将在后续版本中补充完善。

执行应用评测的操作步骤

  1. 进入评测页面:打开工作台下的应用评测目录,点击右上角的「创建任务」按钮。
  2. 填写评测信息:在创建任务页面,需填写评测任务名(任务的标识名称)、评测模型(用于本次任务打分的模型)、评测应用(需要被打分的目标应用)。
  3. 准备评测数据:选择评测应用后,系统会弹出下载CSV模板的按钮,模板包含全局变量、q(问题)、a(标准答案)、历史记录四个字段。需注意:最多支持1000组问答对,且必须严格按照模板格式填写数据。
  4. 完成上传与启动:填写完成后上传文件,点击「开始评测」即可创建评测任务。

查看评测结果时,可在评测列表页面查看所有任务的关键信息,包括进度、执行人、评测应用名称、开始/结束时间、综合评分,用于对比应用改进后的效果。点击「查看详情」可进入任务详情页,顶部展示任务概览(含评测配置和统计结果),下方展示每条问答对的详细结果,包括用户问题、标准输出、应用输出。使用该功能时需注意,当前仅支持回答准确性指标,若需其他评估指标或问答对数量超过1000组,暂无法通过该功能完成评测。

来源:https://doc.fastgpt.cn/zh-CN/guide/build/evaluation