这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料涉及多种数据类型和复杂结构。其数据来源主要包括临床试验报告(I、II、III期)、非临床研究报告(药代动力学、药效学、毒理学)、生产工艺验证文件、质量标准与检验方法、以及已发表的科学文献。这些数据更新频率相对较低,通常随研发进展和监管要求阶段性提交。文档结构上,ADC资料呈现高度模块化特征,例如通用技术文档(CTD)格式,包含模块1(行政信息和申报信息)、模块2(CTD概述)、模块3(质量)、模块4(非临床研究报告)、模块5(临床研究报告)。其中,模块3的生产工艺、质量控制数据,以及模块5的临床数据,常涉及复杂的生物大分子特性参数(如抗体糖基化、偶联比 DAR)、小分子毒素结构、连接子稳定性、释放机制等。字段与单位具有高度特异性,例如 DAR 值通常以整数或小数表示,单位为 mol/mol;抗体浓度以 mg/mL 表示;毒素载荷量以 µg/mg 或 µg/mL 表示。
这些特征在「引用来源与溯源」这一环带来什么约束
ADC申报资料的模块化结构要求引用来源必须能够精确指向CTD的特定模块、章节、页码甚至段落,以确保溯源的准确性。其数据更新频率低,意味着引用内容在较长时间内保持稳定,但一旦更新,则需要严格的版本控制和引用刷新机制。大量复杂的生物大分子和小分子特性参数,使得引用内容需要支持对特定图表、表格或实验结果的精细定位,例如指向某个批次分析报告中的特定色谱图或质谱图。此外,由于涉及跨学科数据(生物学、化学、临床医学),引用系统必须能够处理不同来源和格式的文档,例如PDF格式的临床报告、Excel格式的分析数据或Word格式的综述性文件。对引用内容的合理性检查,需要结合ADC的特有机制(如偶联稳定性、毒素释放动力学),判断引用的实验数据或论述是否支持申报结论。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | ADC申报资料段落通常较长,包含详细描述和数据,过短分段可能割裂语义,影响引用完整性。 |
召回条数 | 前 8–12 条 | 确保覆盖ADC复杂机制和多维度数据,提高相关信息召回率。 |
相似度阈值 | 0.75–0.85 | 兼顾准确性与召回率,避免无关内容被引用,同时确保关键技术细节不被遗漏。 |
重排返回条数 | 前 5 条 | 聚焦最相关的关键信息,减少工程师审查负担,提高溯源效率。 |
引用元数据字段 | 文件路径, 页码, 图表ID | ADC申报资料对精确溯源至CTD具体位置有强需求,这些字段是基础。 |
引用一致性检查 | 按实测标定 | 针对ADC特有参数(如DAR值范围、稳定性数据),校验引用数据与申报内容逻辑一致性。 |
容易做错的三处
- 引用回复未能提供具体的文件名或页码,导致无法快速定位原始资料,原因是没有在知识库构建时提取并关联足够细粒度的元数据。
- 大模型在检查引用内容合理性时,将ADC偶联效率数据与非ADC药物的药代动力学数据混淆,原因是知识库中缺乏针对ADC特性的领域知识校准,或检索到的上下文不足以区分。
- 引用多个变量时系统报错
quote type error,现象是引用的数据类型与预设的变量类型不匹配,例如尝试将一个文本段落引用到数值型变量中。
怎么确认配好了
- 随机抽取 10 份已完成引用的申报资料片段,检查其引用的文件路径、页码和段落是否与原始资料精确对应。
- 针对 ADC 关键技术参数(如 DAR 值、连接子稳定性),提交查询并验证模型回复中引用的数据是否在合理范围内,并能溯源到对应的实验报告。
- 模拟不同复杂度的查询,包括涉及多个数据点和跨文档引用的场景,观察系统返回的引用条目数量是否与预期一致,并检查是否存在无关引用。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。