这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料涉及生物制剂、小分子药物以及连接技术的多重数据类型。数据来源包括临床前研究报告、临床试验报告、CMC(化学、制造与控制)文件、药理毒理学报告、质量控制标准及法规符合性文件。这些资料通常以 PDF、Word 文档和结构化数据表(如 Excel)的形式存在。文档更新频率较高,尤其是在临床试验阶段,数据会持续累积和修订。文档结构复杂,包含大量专业术语、缩写、图表和表格。关键字段包括抗体序列、有效载荷结构、偶联比(DAR)、批次号、分析方法、稳定性数据和药代动力学参数。单位涵盖摩尔浓度(nM)、剂量(mg/kg)、时间(h)、温度(℃)等,精确性和一致性要求极高。
这些特征在「向量模型与索引」这一环带来什么约束
ADC 注册申报资料的复杂性对向量模型和索引提出了特定要求。首先,多模态数据源和复杂文档结构意味着需要能够处理文本、表格和图表信息的向量模型,单一的文本嵌入模型可能不足以捕捉全部语义。其次,专业术语和缩写密集,要求向量模型具备高度的领域专业知识,以避免语义漂移或误解。高更新频率则要求索引系统支持高效的增量更新和版本管理,确保检索到的信息始终是最新且准确的。此外,对精确性和一致性的高要求,使得相似度搜索的阈值设置需格外精细,避免召回不相关或语义模糊的结果,影响合规性判断。最后,关键字段和单位的识别与提取能力,对向量化和查询过滤策略提出挑战,需要结合元数据过滤才能有效缩小搜索范围。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾上下文完整性与向量模型处理能力,避免过长文本稀释关键信息。 |
分段重叠长度 | 100–200 字符 | 确保跨段落的语义连贯性,尤其对复杂描述和论证段落。 |
召回条数 | 前 20 条 | 增加初始召回范围,以应对专业术语可能导致的弱匹配。 |
相似度阈值 | 按实测标定,区间在 0.75–0.85 之间 | 针对 ADC 领域术语的精确性要求,结合领域语料库测试确定。 |
重排返回条数 | 前 5 条 | 聚焦最相关内容,减少工程师筛选负担,提升效率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 和复杂表格解析,避免超时导致索引失败。 |
容易做错的三处
- 知识库状态长期处于“索引中”:这通常是由于文件解析超时或向量模型服务连接中断,特别是处理大型或格式复杂的 ADC 资料文件时。
- 搜索结果相似度值异常高(如 10000+):这表明向量模型配置或数据归一化存在问题,导致相似度计算结果超出预期范围,无法进行有效过滤。
- 检索结果与预期偏差大,关键信息缺失:可能的原因是分段策略不合理,导致重要上下文被切断,或向量模型领域知识不足,无法准确理解 ADC 资料中的专业术语。
怎么确认配好了
- 上传典型 ADC 申报资料样本,检查知识库索引状态是否正常完成,并验证文件解析日志是否存在异常。
- 使用包含 ADC 核心概念的查询语句进行检索,检查返回结果的
相似度值是否在合理区间内,并能通过调整相似度阈值有效过滤。 - 针对特定 ADC 药物的关键字段(如偶联比、批次信息)进行精确查询,核对召回文档中是否包含这些字段的准确信息,并检查
重排返回条数内的结果相关性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。