这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料具有其独特性。数据来源广泛,包括临床试验报告(Phases I-III)、非临床研究报告(药理毒理、药代动力学)、生产工艺验证文件、质量控制标准及检测方法、稳定性研究数据、以及监管机构发布的指导原则和问答集。这些资料更新频率不一,临床数据可能随试验进展季度或年度更新,而生产工艺和质量标准则相对稳定,仅在发生重大变更时修订。文档结构复杂,常以 ICH CTD(通用技术文件)格式组织,包含多个模块和层级。字段与单位多样,例如临床报告中的剂量单位(mg/kg)、疗效指标(ORR、PFS)、安全性事件编码(MedDRA),以及质量文件中抗体浓度(mg/mL)、药物连接比(DAR)、偶联率等特有指标。
这些特征在「知识库检索与召回」这一环带来什么约束
ADC 资料的复杂性和多样性对知识库检索与召回提出了具体要求。多层级文档结构意味着需要支持深层语义理解和上下文关联,避免浅层匹配导致的误召回。频繁更新的临床数据要求知识库具备高效的增量更新机制,确保检索结果的时效性。特有的生物医药字段和单位,例如 DAR 值、MedDRA 编码,要求分词器和嵌入模型能准确识别和处理这些专有名词及数值,避免将其作为普通词汇处理而丢失信息。此外,注册申报资料中常包含大量表格和图片,知识库需有效解析并利用这些非文本信息,将其纳入检索范畴,提升召回的全面性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性与召回效率,避免单段信息量过小或过大。 |
召回条数 | 8–12 条 | 在保证信息覆盖度的前提下,控制输入给 LLM 的上下文长度,降低计算成本。 |
相似度阈值 | 按实测标定 | 针对 ADC 专有术语和数值进行校准,确保高相关性召回,过滤低质量结果。 |
重排返回条数 | 3–5 条 | 进一步精炼召回结果,提升最终呈现给用户的信息质量和相关性。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 应对大型临床试验报告和工艺文件解析可能耗时较长的情况。 |
maxContext | 32000 token | 确保能够容纳多个召回片段及其上下文,支持复杂问题回答。 |
容易做错的三处
- 检索结果与提问不匹配,语义得分却很高:原因在于嵌入模型对 ADC 领域专业术语的理解不足,导致向量表征偏离实际语义。
- 知识库更新后,部分新资料无法被检索到:原因在于增量索引机制配置不当或更新频率过低,未能及时将新数据纳入索引。
- 回答耗时过长,用户体验不佳:原因在于
召回条数设置过高,或分段长度过小导致需要处理大量碎片化上下文。
怎么确认配好了
- 针对 ADC 核心概念和特有指标进行测试性提问,检查召回结果的相关性和准确性。
- 上传最新的临床试验数据和指导原则,并立即进行检索,验证新内容的召回效果。
- 在不同网络环境下,模拟用户提问,记录并分析从提问到获得回答的平均响应时间。
- 检查检索日志,核对
相似度阈值和重排返回条数是否有效过滤了低相关性内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。