这个品类的数据长什么样
抗体偶联药物(ADC)研发文档数据来源多样,包括临床试验报告、专利文献、生物学研究论文、内部实验记录、生产工艺文件等。这些文档更新频率不一,临床试验数据和专利信息可能按季度或年度更新,而内部实验记录则实时生成。ADC文档的结构复杂,常包含大量非结构化文本、图片、表格及分子结构图。关键字段包括抗体靶点、偶联子类型、毒素分子、偶联方式(如赖氨酸偶联、半胱氨酸偶联)、DAR值(药物抗体比)、体内外药效数据、药代动力学(PK)参数、药效学(PD)参数、毒理学数据、生产批次信息和质量控制(QC)指标。单位方面,剂量常用 mg/kg,浓度常用 µg/mL 或 nM,时间单位多为小时或天。
这些特征在「多轮对话与提示词」这一环带来什么约束
ADC研发文档的复杂性对多轮对话和提示词设计提出了特定要求。其多模态信息(文本、表格、图像)意味着仅依赖文本解析不足以获取完整信息,需要RAG(检索增强生成)系统能有效处理各类嵌入。数据更新的非同步性要求知识库具备增量更新能力,并能区分最新版本与历史版本,避免模型引用过时信息。文档结构的高度非标准化使得通用分段策略效果不佳,需要根据ADC特有字段和章节逻辑进行定制化分段。例如,DAR值、PK/PD参数等关键数值常散布于不同表格或段落,提示词需要引导模型跨文档、跨结构地进行信息整合。此外,专业的生物医药术语和分子结构命名对大模型理解和生成准确回答构成挑战,需要通过领域词表和示例进行强化。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 适应ADC文档中包含较长实验描述和方法论的段落,保证上下文完整性。 |
召回条数 | 前 8–12 条 | ADC研发信息关联性强,增加召回条数有助于覆盖更多相关实验数据和细节。 |
相似度阈值 | 0.78–0.85 | 领域术语相似度高,需要较高阈值确保召回结果的精确性和相关性。 |
重排返回条数 | 前 5 条 | 经过重排后,最相关的少数几条通常包含核心关键数据,减少模型处理负担。 |
引用内容模板 | “文件:{文件名}, 段落:{段落内容}” | 明确提示模型信息来源,便于追溯和验证,尤其在ADC数据交叉引用较多的场景。 |
提示词最大长度 | 3000–4000 token | 确保能够包含用户的多轮对话历史、召回的ADC专业文档内容以及详细的指令。 |
容易做错的三处
- 模型回答中关键数值(如DAR值、PK参数)缺失或错误。这是因为知识库分段未能有效识别并提取表格或非结构化文本中的具体数值,导致召回的上下文不完整。
- 多轮对话中模型无法保持对特定ADC分子的跟踪。这是由于提示词未有效引导模型在对话历史中维持对特定药物名称、靶点或批次号的记忆,导致上下文丢失。
- 模型在回答中引用了过时的临床数据。这通常是知识库更新机制不完善,未能及时标记或移除旧版本文档,导致RAG系统召回了非最新数据。
怎么确认配好了
- 针对典型ADC研发查询,进行多轮对话测试,检查模型能否准确提取并整合不同文档中的关键数值(如DAR值、效价),核对提取结果与原始文档数据的一致性。
- 提交包含模糊术语或简称的查询,观察模型是否能正确理解并关联到知识库中对应的ADC专业词汇,以此判断领域词表和嵌入模型的效果。
- 模拟新增或更新ADC研发文档后,再次进行相关查询,验证模型是否优先引用最新版本的信息,并能清晰区分新旧数据,以此判断知识库的更新策略是否有效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。