这个品类的数据长什么样
偏差与 CAPA(Corrective and Preventive Action)在临床试验预筛场景下,数据主要来源于内部质量管理体系、审计报告、调查记录、根本原因分析文档以及已批准的 CAPA 计划。这些文档通常以 PDF、Word 或结构化的数据库记录形式存在。数据更新频率不一,轻微偏差或局部性 CAPA 可能每周更新,而涉及重大系统性问题的 CAPA 计划及进展则可能每月或每季度更新。文档结构上,通常包含事件描述、发生日期、影响评估、根本原因、纠正措施、预防措施、责任人、完成期限和状态等字段。部分数据可能包含图片、图表或扫描件,其中文字信息需通过 OCR 识别。字段内容多为文本描述,涉及日期、项目编号、责任人姓名等标准化信息。
这些特征在「知识库检索与召回」这一环带来什么约束
偏差与 CAPA 数据的多源异构性、文本描述性强以及部分内容的半结构化特点,对知识库检索与召回提出了特定要求。首先,文档中存在大量专业术语和缩略语,需要精确匹配或语义理解以提升召回准确率。其次,事件描述、根本原因分析等字段的文本长度差异大,且包含关键因果关系,对文本切分策略有较高要求,避免关键信息被割裂。部分扫描件和图片中的文字信息,如未能有效识别,将导致检索遗漏。此外,CAPA 计划的动态更新性质,要求知识库具备高效的增量更新机制,以确保检索结果的时效性。字段的标准化程度不一,使得基于字段的过滤和排序需要更灵活的配置,例如对“责任人”字段进行模糊匹配。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | 适应偏差与 CAPA 描述和分析文本的长度,确保上下文完整性 |
重叠长度 | 150 字符 | 保证切分边界处的语义连贯性,避免关键信息丢失 |
召回条数 | 前 8 条 | 覆盖潜在相关的多个偏差或 CAPA 记录,提高召回率 |
相似度阈值 | 按实测标定 | 平衡召回的精准性和广度,需根据实际数据进行调整 |
重排返回条数 | 前 5 条 | 在初次召回基础上进行二次排序,提升核心结果的排名 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型或复杂文档(如审计报告)的解析时间 |
容易做错的三处
- 知识库训练长时间处于“训练中”或“正在重建”状态,无法切换索引,原因通常是文件解析超时或切分任务卡顿,特别是处理包含大量图片或复杂表格的 PDF 文档时。
- 提问后未能引用知识库文件,常见于
相似度阈值设置过高,导致相关度稍低的文档片段无法被召回,或者文档切分粒度过细,使得单个片段缺乏足够语义信息。 - 上下文引用中,文档格式未正确渲染为 Markdown 格式,通常是由于知识库存储的原始文档格式未被正确识别或转换,导致在展示时无法应用相应的渲染规则。
怎么确认配好了
- 上传具有代表性的偏差报告和 CAPA 计划文档,检查知识库文档状态,确保所有文档均已成功完成解析和切分。
- 使用一系列模拟临床试验预筛问题进行测试,核对召回结果中是否包含预期的偏差与 CAPA 记录,并评估召回条目的相关性。
- 检查召回结果的
相似度分数分布,并结合人工评估判断相似度阈值的合理性,确保高相关性内容能被有效召回。 - 验证上下文引用中的文档片段,确认其内容完整性、格式渲染正确性,以及是否包含关键字段信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。