这个品类的数据长什么样
抗体偶联药物 ADC 的质量文档通常包含产品批次报告、检测方法验证文件、稳定性研究数据、原辅料放行记录等。这些文档以 PDF、Word 或 Excel 格式为主,内部结构复杂,常包含图表和大量专业术语。数据更新频率与产品生命周期相关,例如批次报告随生产批次生成,稳定性数据则按预设时间点持续更新。文档中的字段包括批号、生产日期、有效期、检测项目、检测结果、单位(如 ug/mL、%)、质控限度等,且常涉及多个版本修订。
这些特征在「知识库检索与召回」这一环带来什么约束
ADC 质量文档的复杂结构和专业术语对知识切分提出了挑战,需要避免语义断裂。多版本修订意味着知识库需要有效管理版本信息,确保检索到最新或指定版本的内容。Excel 表格中包含的结构化数据,传统文本切分可能无法有效保留其上下文关联,影响检索准确性。频繁更新的数据需要知识库具备高效的增量更新机制,避免重复处理大量不变内容。此外,文档中包含的特定单位和质控限度等数值信息,要求向量化模型能捕捉其内在含义,以便在检索时区分细微的质量差异。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性与召回效率,避免过长段落稀释关键信息。 |
分段重叠 | 50 字符 | 确保上下文连续性,减少因切分导致的关键信息丢失。 |
召回条数 | 8–12 条 | 在保证召回相关性的前提下,提供足够多的潜在匹配项供重排模型选择。 |
相似度阈值 | 按实测标定 | 根据实际查询效果和数据分布,平衡查全率与查准率。 |
重排返回条数 | 3–5 条 | 聚焦最相关的结果,减轻下游大模型处理负载,提高响应速度。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 或 Word 文档解析耗时较长的情况,避免解析超时。 |
容易做错的三处
- 上传 CSV 文件后,内容显示乱码,尤其是中文部分。这通常是由于 CSV 文件编码格式与系统默认编码不一致,例如文件是 GBK 编码,系统按 UTF-8 读取。
- 检索结果中出现大量与查询不相关的历史版本文档。这是因为知识库未有效进行版本管理或过滤,导致旧版本数据被召回。
- 导入大型文档后,知识库占用磁盘空间迅速增加,远超预期。这可能源于文档切分粒度过细,生成了过多冗余的文本块和向量,或者原始文件未及时清理。
怎么确认配好了
- 选择几份具有代表性的 ADC 质量文档,分别进行上传和切分,检查切分后的文本块内容是否语义完整、无明显截断,特别是表格和图注附近。
- 针对特定批号或检测项目的查询,观察召回结果中是否包含该批号的最新批次报告及相关检测数据,以及历史版本是否被有效过滤。
- 模拟用户查询“某批次产品纯度检测结果”,检查召回结果是否能准确返回包含纯度百分比和对应单位(如
%)的文本段落。 - 上传一份包含复杂表格的 Excel 文档,查看切分结果是否能保持表格内部数据的关联性,例如检测项目和对应数值是否在同一文本块或紧邻的文本块中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。