这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料涉及多学科数据,包括药学研究(CMC)、非临床研究(药理毒理)和临床研究数据。药学部分包含抗体、连接子、有效载荷的合成工艺、质量控制、稳定性研究报告。非临床研究资料涵盖体内外药效学、药代动力学(ADME)和毒理学研究报告。临床研究资料则包括I、II、III期临床试验方案、研究者手册、临床研究报告以及统计分析计划。这些数据通常以结构化(如表格、数据库导出文件)和非结构化(如PDF文档、Word报告、图片、图谱)形式存在。数据更新频率高,尤其是在研发后期和上市申请阶段,会不断补充新的研究结果和修订文件。文档结构复杂,常引用不同章节或附件,字段与单位严格遵循药监机构的规定,例如剂量单位通常为 mg/kg,浓度单位为 μg/mL,时间单位为小时或天。
这些特征在「多轮对话与提示词」这一环带来什么约束
ADC申报资料的复杂数据结构和高更新频率,对多轮对话与提示词设计提出了具体要求。非结构化文档占比较高,意味着需要强大的文本解析能力来提取关键信息,以支撑后续的RAG检索。例如,ADC的CMC部分常包含复杂的合成路线图和质谱图,这些非文本信息需要辅助性的图像识别或人工标注来增强模型理解。频繁的数据更新要求知识库具备高效的增量更新机制,避免模型基于过时信息生成回复。对话过程中,由于申报资料的专业性,模型需要精确理解专业术语和上下文,例如区分不同连接子类型或有效载荷的作用机制。此外,字段与单位的严格性要求模型在生成回答时能准确引用,避免因单位错误导致信息失真,这需要提示词中明确强调对数值和单位的校验。跨文档引用多,使得对话系统需要能进行多源信息整合,以回答涉及多个研究报告的问题。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | ADC申报资料中的段落通常较长,包含详细的实验方法和结果,过短分段会丢失上下文。 |
召回条数 | 前 8–12 条 | 确保能覆盖ADC复杂研究背景中的多个相关信息点,提高回答的全面性。 |
相似度阈值 | 0.78–0.85 | 平衡召回精度与泛化能力,避免低相关度内容干扰,同时保证能检索到细微差异。 |
重排返回条数 | 前 5 条 | 经过重排能更精准地筛选出与ADC具体问题最相关的片段,提升信息准确性。 |
maxContext | 4096 tokens | 适应ADC注册申报资料中问题通常涉及的上下文长度,保证多轮对话的连贯性。 |
ENABLE_HISTORY_MEMORY | true | 维持ADC申报资料审核过程中的多轮问答逻辑,保留上下文进行追问。 |
容易做错的三处
- 对话结果中出现单位错误或数值混淆,例如将 mg/kg 误写为 μg/kg,通常是由于提示词中未明确强调对数值和单位的严格校验,或知识库切片时未保留单位信息。
- 模型无法回答涉及多个报告交叉验证的问题,表现为回答片面或遗漏关键信息,原因在于知识库构建时缺乏有效的跨文档关联机制,导致多源信息整合能力不足。
- 在更新新的研究数据后,模型仍基于旧数据进行回答,这表明知识库的增量更新策略执行不力,未能及时同步最新版本的申报资料。
怎么确认配好了
- 针对典型ADC申报资料中的复杂问题,进行多轮对话测试,检查回复中关键数值、单位和专业术语的准确性。
- 模拟资料更新场景,导入修订后的文档,然后提问相关问题,确认模型能基于最新数据生成回答。
- 选择几个跨多个研究报告才能回答的问题,验证模型是否能整合不同来源的信息并给出连贯、完整的回答。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。