这个品类的数据长什么样
DTP 药房在临床试验预筛场景中的数据主要来源于药房管理系统 (PMS)、患者用药记录、处方信息以及患者同意共享的匿名化健康数据。数据更新频率通常为每日或实时,特别是在患者购药和处方流转时。文档结构以结构化数据为主,例如 JSON 或 XML 格式的患者档案、药品批次信息和销售记录。关键字段包括 patient_id、drug_code (例如 ATC 编码)、dosage、prescription_date、pharmacy_id。部分数据可能以 PDF 格式的医生诊断报告或纸质病历扫描件形式存在,需要额外的 OCR 处理。单位通常涉及剂量(毫克、毫升)、频率(每日次)、疗程(天数)。
这些特征在「引用来源与溯源」这一环带来什么约束
DTP 药房数据的高度结构化和实时更新特性,对引用来源的准确性和时效性提出了严格要求。由于数据直接关联患者用药,任何引用错误都可能影响预筛结果的准确性。实时更新的特性意味着知识库在引用时必须能够捕获最新的患者用药状态,避免使用过期信息。PDF 格式的非结构化数据需要鲁棒的解析能力,确保关键字段如诊断描述、用药禁忌被准确提取并纳入引用范围。数据源分散在多个系统(PMS、电子处方平台)要求引用机制能跨系统追溯,定位到具体的数据记录和其原始来源,例如特定的处方 ID 或患者访问记录。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2000 字符 | 确保在有限的上下文窗口内包含足够的患者用药和处方详情。 |
召回条数 | 前 5 条 | 平衡召回效率与信息噪音,集中于最相关的用药或诊断记录。 |
相似度阈值 | 0.75 | 过滤掉不相关的患者信息或药品说明,提高匹配精准度。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适应处理大型 PDF 格式医生诊断报告的 OCR 和解析时间。 |
重排返回条数 | 前 3 条 | 在初次召回基础上,进一步精炼最直接支持预筛判断的证据。 |
EXTERNAL_DATA_REFRESH_INTERVAL | 60 分钟 | 确保知识库引用的是 DTP 药房最新的患者用药和处方数据。 |
容易做错的三处
- 预筛结果中引用的药品剂量或频率与患者实际用药记录不符,原因在于知识库同步外部数据源的频率过低,未能及时更新患者最新处方。
- 系统在解析医生手写或扫描的诊断报告时遗漏关键禁忌信息,导致预筛模型无法引用,原因在于 OCR 引擎对特定医学术语或版式识别能力不足。
- 在调用外部工具上传文件参数时,工具无法正确引用变量,导致文件上传失败,原因在于工具接口仅支持直接链接或硬编码值,不支持动态变量传递。
怎么确认配好了
- 选择一个已知用药禁忌的虚拟患者档案,验证预筛结果是否准确引用了该禁忌,并能追溯到具体的电子处方 ID。
- 上传一份包含复杂医学术语和图表的 PDF 诊断报告,检查报告中的关键信息(例如
诊断结果、治疗方案)是否被正确提取并纳入知识库,同时验证其引用来源是否指向该 PDF 文件。 - 随机抽取 10 个预筛结果,核对其中引用的药品信息(
drug_code、dosage、prescription_date)是否与 DTP 药房管理系统中的原始记录完全一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。