这个品类的数据长什么样
抗体偶联药物 ADC 的质量文档主要来源于研发过程中的实验记录、批生产记录、质量标准、分析方法验证报告、稳定性研究报告以及法规申报资料。这些文档更新频率较高,尤其在临床试验阶段和上市后变更阶段。文档结构复杂,通常包含大量图表、化学结构式、谱图数据和专业术语。字段与单位具有高度特异性,例如抗体偶联比 (DAR)、药物负载量、纯度(如 SEC-HPLC 纯度)、内毒素含量、pH 值、生物活性单位等,并严格遵循药典(如 USP、EP、JP)和 ICH 指导原则。
这些特征在「向量模型与索引」这一环带来什么约束
ADC 质量文档的复杂性对向量模型与索引提出了特定要求。高更新频率意味着索引需要支持高效的增量更新机制,避免频繁的全量重建。文档中的图表、化学结构式和谱图数据无法直接通过文本向量化捕捉,需要引入多模态处理或在文本描述中尽可能包含关键信息。专业术语和缩写(如 ADC、DAR、mAb)的上下文依赖性强,可能影响通用预训练模型的理解,需要针对生物医药领域进行领域适应性训练或词表扩展。字段与单位的严格性要求在分块时保留其完整性,避免关键数值与单位分离,影响召回精度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾上下文完整性与向量化效率,避免关键信息被截断。 |
分段重叠长度 | 100–200 字符 | 确保相邻分段间的语义连续性,尤其在跨段落讨论关键指标时。 |
召回条数 | 前 5 条 | 在保证召回相关性的同时,减少后续重排和生成阶段的计算负担。 |
相似度阈值 | 按实测标定 | 需根据 ADC 质量文档的实际语义分布,通过测试集确定合适值,确保高召回率。 |
maxContext | 4000 字符 | 适应 ADC 质量文档中可能出现的较长段落和复杂描述。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 考虑到文档可能包含大量图表或复杂结构,解析时间可能较长。 |
容易做错的三处
- 现象:知识库状态长时间显示“训练中”或“正在重建”,无法切换索引。原因:文档解析或向量化过程中遇到异常数据格式(如损坏的 PDF、无法识别的图表),导致流程阻塞或重试循环。
- 现象:查询关于特定纯度指标时,召回的文档片段不包含完整的数值与单位信息。原因:分段策略未能有效识别并保留“数值 + 单位”作为一个整体,在分段时将其拆散。
- 现象:批量添加索引时,部分文档未能成功入库或入库后无法被检索。原因:API 请求参数中
chunk_size或overlap_size设置不当,或metadata字段未正确传递关键标识符。
怎么确认配好了
- 选择代表性的 ADC 质量文档,进行入库操作,并检查知识库状态是否正常转变为“已完成”。
- 构建包含特定 ADC 指标(如
DAR 2.5、SEC-HPLC 99.5%)的查询,检查召回结果是否包含这些完整且准确的数值和单位。 - 针对文档中常见的专业缩写(如
mAb、ADME),进行模糊查询,验证召回结果的语义相关性,并确认相关文档是否被正确索引。 - 通过 API 接口查询索引的元数据,检查
document_id、chunk_id等关键标识符是否按预期生成且唯一。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。