这个品类的数据长什么样
抗体偶联药物(ADC)的数据主要来源于临床试验报告、专利文献、学术论文、监管机构(如 FDA、EMA)的审批文件以及专业的药物数据库。这些数据更新频率较高,尤其在临床研究阶段,新数据会持续发布。文档结构通常包含靶点信息、偶联技术、毒素分子、连接子、药物抗体比率(DAR)、药代动力学(PK)数据、药效学(PD)数据、临床疗效与安全性报告等。字段与单位具有高度专业性,例如 DAR 值通常为无单位整数或小数(如 2.0、4.0),半衰期以小时或天为单位,药物浓度以纳克/毫升(ng/mL)表示,而毒素的 IC50 值则以纳摩尔(nM)为单位。
这些特征在「多轮对话与提示词」这一环带来什么约束
ADC 数据的专业性和复杂性对多轮对话与提示词设计提出了特定要求。首先,高更新频率的数据需要知识库能快速同步,确保 AI 回答的时效性,避免提供过时信息。其次,文档中包含大量专业术语和缩写,要求提示词能有效引导模型理解上下文,并进行准确的实体识别和关系抽取。例如,DAR 可能指药物抗体比率,也可能在其他语境下有不同含义,提示词需明确其在 ADC 领域的专指。此外,不同字段的单位差异大,模型在生成回答时需要注意单位的匹配与转换,避免产生量纲错误。对话过程中,用户可能频繁追问特定药物的 PK/PD 数据或不同 ADC 之间的疗效对比,这要求多轮对话能保持状态,理解后续问题的隐含关联,避免重复提问或信息丢失。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 6 | 确保多轮对话能覆盖 ADC 药物研发的多个关键环节,维持上下文连贯性。 |
分段长度 | 800–1000 字符 | 适应 ADC 临床报告和专利文档中较长的专业描述段落,减少语义割裂。 |
召回条数 | 前 8 条 | 增加从知识库检索到相关 ADC 数据的机会,特别是涉及多维度比较时。 |
相似度阈值 | 0.78 | 在保证召回率的同时,过滤掉与 ADC 产品关联度较低的非核心信息。 |
重排返回条数 | 前 5 条 | 精炼检索结果,将与用户查询最相关的 ADC 药物或特性信息优先展示。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 ADC 临床试验报告或专利文档解析可能耗时较长的情况。 |
容易做错的三处
- 在用户询问特定 ADC 药物的副作用时,AI 仅返回了通用毒性,未提及该药物特有的不良反应。原因在于知识库中关于特定 ADC 药物的详细毒理数据未被有效索引或提示词未明确要求。
- 多轮对话中,用户追问某 ADC 药物的
DAR值,但 AI 给出的是连接子类型。原因在于提示词对缩略词DAR的消歧义处理不足,导致模型误解用户意图。 - 工作流执行到一半突然中断,对话日志显示
Workflow execution failed: knowledge base search returned no results。原因在于知识库中缺少用户查询的 ADC 产品数据,或者数据更新不及时。
怎么确认配好了
- 测试不同 ADC 药物的查询,验证对话系统能否准确提供其靶点、毒素和连接子等核心信息,并核对返回信息的专业术语是否正确。
- 模拟多轮对话场景,例如先询问某 ADC 的作用机制,再追问其在特定癌症类型中的疗效数据,检查 AI 是否能保持上下文连贯性并给出准确回答,可以对比监管机构官网信息。
- 随机抽取知识库中的 ADC 药物数据,通过提示词进行提问,核对 AI 回答中的数值字段(如
IC50值、半衰期)是否与原始数据匹配,并验证单位是否正确。 - 检查系统日志,确认在处理复杂查询或长文档解析时,没有出现
PARSE_FILE_TIMEOUT_SECONDS超时或knowledge base search returned no results等错误,确保知识库能够被有效利用。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。