这个品类的数据长什么样
DTP 药房在临床试验预筛场景下的数据主要来源于药厂提供的临床试验方案、患者招募标准、药物说明书、研究者手册(IB)以及内部积累的患者病历概要。这些数据更新频率较高,新药上市、临床试验进展或方案修订均会引发数据更新,通常以月度或季度为周期。文档结构通常为 PDF 格式的非结构化文本,包含大量医学术语、剂量单位(如 mg/kg、IU)和特定字段(如 入组标准、排除标准、不良事件)。部分数据可能以结构化表格形式存在于 PDF 报告中,描述患者特征或治疗结果。
这些特征在「知识库检索与召回」这一环带来什么约束
DTP 药房临床试验预筛的数据特征对知识库检索与召回提出了多重约束。首先,非结构化医学文本的语义复杂性要求RAG系统具备强大的语义理解能力,能够准确识别医学实体和关系。其次,高频的数据更新意味着知识库需要高效的增量更新机制,避免召回过期或错误的试验信息。PDF 文档中嵌套的表格数据,其结构化信息在传统文本分块中容易丢失,影响对患者特征的精确匹配。此外,严格的入组和排除标准需要系统能够精确匹配多个条件,例如患者的年龄、疾病阶段、合并用药等,任何细微的偏差都可能导致预筛结果不准确。对剂量单位和特定字段的识别,例如 mg/kg 或 不良事件,是确保检索准确性的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾医学文本的上下文完整性与检索效率,避免过长分段引入无关信息。 |
分段重叠 | 50-100 字符 | 确保分段边界处的关键信息不丢失,提高召回的鲁棒性。 |
召回条数 | 8-12 条 | 在保证覆盖率的同时,控制后续重排和生成阶段的计算量,降低 30 秒 以上的响应时间。 |
相似度阈值 | 按实测标定 | 需结合具体数据集和业务需求,通过小样本测试确定,通常在 0.75-0.85 之间。 |
重排返回条数 | 3-5 条 | 进一步精炼召回结果,提升最终答案的精准度,减少不必要的计算开销。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型临床试验方案 PDF 文件解析可能耗时较长的情况,避免解析超时。 |
容易做错的三处
- 现象:API 调用知识库时返回内容不包含知识库信息。原因:API 调用未正确传递
chat_id或app_id,导致请求未关联到指定的知识库。 - 现象:知识库内容增加后,检索响应时间显著变慢,超过
30 秒。原因:召回条数或重排返回条数设置过高,导致检索和重排阶段计算量过大。 - 现象:DTP 药房临床试验预筛结果错误地将不符合标准的患者纳入。原因:分段策略未能有效保留 PDF 文档中表格形式的入组/排除标准,导致关键结构化信息在检索时丢失。
怎么确认配好了
- 通过FastGPT管理界面,上传典型的临床试验方案 PDF 文件,检查文件解析后的分段预览,确保关键信息(如
入组标准、排除标准)被完整且独立地分段。 - 模拟患者真实问询,输入与临床试验预筛相关的多轮对话,观察系统返回的召回内容是否准确覆盖了患者特征和试验标准,并与原始文档进行比对,确认召回的
相似度指标。 - 使用 FastGPT 提供的 API 接口进行批量测试,记录不同
召回条数和重排返回条数配置下的响应时间,并根据业务可接受的延迟范围确定阈值。 - 针对包含剂量单位(如
mg/kg)和特定字段(如不良事件)的查询,验证召回结果是否能准确识别并匹配这些信息,必要时调整分词器配置或向量模型。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。