这个品类的数据长什么样
医学事务注册申报资料准备的数据主要来源于药品研发过程中的各类报告、临床试验数据、法规指南、已上市药品的说明书及国内外监管机构发布的审评意见。这些数据更新频率相对较低,通常伴随新药研发阶段性成果或法规政策调整而更新。文档结构以PDF、Word、Excel等格式为主,包含大量结构化和半结构化文本,如详细的实验方法、统计结果、不良事件报告、药理毒理数据和临床总结。字段与单位具有高度专业性,例如剂量(mg/kg)、浓度(μg/mL)、P值、置信区间等,且常涉及特定医学术语和缩写。
这些特征在「知识库检索与召回」这一环带来什么约束
数据来源的专业性和文档结构的复杂性要求知识库能够精准识别和解析各类医学术语及数据格式。较低的更新频率意味着知识库内容相对稳定,但每次更新需要确保数据完整性和版本控制。大量的PDF和Word文档,尤其是扫描件,对文本提取和OCR能力提出较高要求,确保所有文本内容均可被检索。专业字段和单位的出现,使得简单的关键词匹配不足以满足需求,需要更高级的语义理解和实体识别能力,以区分相似术语或在不同上下文中具有不同含义的词汇。此外,由于申报资料的严谨性,召回结果的准确性和溯源性至关重要,避免信息误读或遗漏。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾段落语义完整性和模型处理效率,避免信息碎片化。 |
最大段落深度 | 3 | 确保解析器能深入文档结构,捕获关键嵌套信息,如章节下的子标题内容。 |
召回条数 | 5-8 条 | 平衡召回广度与模型处理负担,覆盖多个潜在相关知识点。 |
相似度阈值 | 0.75-0.85 | 提高召回精度,过滤掉低相关性结果,减少噪声干扰。 |
重排返回条数 | 3-5 条 | 进一步优化召回结果,将最相关的少量信息置于前端,便于快速决策。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型PDF或Word文档解析耗时较长的情况,避免解析中断。 |
容易做错的三处
- 知识库检索结果中出现大量不相关的临床前毒理数据,原因在于分段长度过长,导致单个段落包含过多无关信息,降低了检索精度。
- 部分关键的药物相互作用信息未能被召回,现象是检索结果缺少特定字段的数据,原因在于知识库在创建时未能正确识别和提取表格或图片中的文本内容。
- 自定义的知识库选择变量在工作流中无法正确赋值,导致检索失败,原因在于变量数据类型与预期不符,未能正确传递知识库ID。
怎么确认配好了
- 选择一份典型的注册申报资料,手动提取其中的关键问题,然后在知识库中进行检索,检查召回结果是否包含预期信息,并评估召回信息的完整性。
- 针对含有复杂表格或图片内容的文档,上传后检查知识库解析后的文本内容,确认表格数据和图片描述是否被正确识别并转化为可检索文本。
- 通过模拟实际申报场景中的提问,观察检索返回的文档片段,评估这些片段是否能直接支持医学事务人员的决策,并检查召回片段是否能追溯到原始文档的准确位置。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。