这个品类的数据长什么样
生物等效性质量文档主要来源于药品注册申报资料、药学研究报告、临床试验报告、药典标准以及监管机构发布的指导原则。这些文档的更新频率相对较低,主要集中在法规政策调整或新药申报批件发布时。文档结构复杂,常包含大量图表、公式、实验数据和专业术语。字段与单位具有高度标准化特征,例如药代动力学参数(AUC、Cmax、Tmax)常使用 ng·h/mL、ng/mL、h 等单位,溶解度、溶出度数据则涉及 mg/mL、% 等。文档中常包含交叉引用和附件。
这些特征在「知识库检索与召回」这一环带来什么约束
生物等效性文档的复杂结构和专业术语,要求知识库在分段时需保持专业内容的完整性,避免关键信息被割裂。图表和公式的存在对文档解析能力提出了挑战,纯文本检索可能遗漏重要上下文。高度标准化的字段和单位,使得精确匹配和数值范围检索成为必要,模糊匹配可能导致结果偏差。文档更新频率低,意味着知识库需要长期稳定地存储和管理这些数据,同时在少量更新发生时能高效地进行增量训练。交叉引用和附件的存在,要求检索结果能有效串联相关信息,提供全面的上下文。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 保障药学、临床等专业论述的完整性,避免关键信息被截断。 |
重叠长度 | 100–200 字符 | 确保分段边界上下文的连续性,提高检索召回率。 |
召回条数 | 8–12 条 | 在保证检索广度的同时,控制返回结果集的规模,便于后续重排与理解。 |
相似度阈值 | 0.75–0.85 | 兼顾精确匹配与语义相关性,过滤掉低相关性结果,减少噪音。 |
重排返回条数 | 3–5 条 | 聚焦最相关的文档片段,提高最终答案的准确性和精炼度。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 文档解析耗时较长的情况,避免解析中断。 |
容易做错的三处
- 知识库文档训练后,部分文档内容缺失或格式错乱,原因为 PDF 解析器未能正确识别复杂的表格或嵌入式图片中的文本内容。
- 调试页面能够检索到相关知识,但通过 API 接口调用时,部分问题未能找到知识库结果,原因为 API 请求参数
similarity或limit设置过于严格,导致有效结果被过滤。 - 文档上传后,长时间处于“训练中”状态,最终报错,原因为文档文件大小超过
UPLOAD_FILE_MAX_SIZE限制,或文档内容过于庞大导致PARSE_FILE_TIMEOUT_SECONDS超时。
怎么确认配好了
- 上传典型生物等效性报告,检查解析后的文档分段是否逻辑完整,尤其关注图表和公式附近的文本内容是否被正确提取。
- 针对关键药代动力学参数、统计学分析方法等专业问题进行检索测试,检查召回结果是否包含多篇相关文档的关键段落,并核对其专业术语和数据是否准确。
- 模拟实际业务场景,使用涵盖不同置信度的问题进行 API 调用测试,观察返回结果的
data.length和similarity值,确保在合理阈值下能召回预期的相关信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。