这个品类的数据长什么样
DTP 药房在临床试验预筛中涉及的数据主要来源于患者病历、处方记录、用药依从性数据以及患者自述信息。这些数据多以非结构化或半结构化形式存在,如 PDF 格式的医学影像报告、医生手写的病历扫描件、CSV 格式的药品销售记录或结构化的电子病历数据。数据更新频率较高,尤其在患者复诊或购药后即时产生新记录。文档结构复杂,包含大量医学术语、缩写和数值,例如血常规报告中的 WBC、HGB,肝功能报告中的 ALT、AST,以及各类指标的参考值范围和实际测量值,单位常见 mmol/L、g/L、IU/L 等。
这些特征在「工作流编排」这一环带来什么约束
DTP 药房数据的高度非结构化特性要求工作流在数据摄取阶段具备强大的文档解析能力,能够从 PDF、图片等多种格式中准确提取文本信息。高更新频率意味着工作流需要支持实时或近实时的触发机制,例如通过 API 接口接收新数据,或者定时批量处理增量数据,以确保预筛结果的时效性。文档中包含的复杂医学术语和数值对知识库的构建和查询提出了更高要求,需要建立专业的医学词典和数值识别规则。此外,由于涉及患者隐私信息,工作流在数据处理和输出环节必须严格遵守数据安全和合规性要求,确保敏感信息脱敏或加密处理,避免泄露。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 适应医学文本的段落长度,兼顾语义完整性和召回效率。 |
召回条数 | 前 10–15 条 | 确保覆盖临床试验入排标准涉及的关键信息,减少漏报。 |
相似度阈值 | 0.75–0.85 | 平衡召回准确率和召回率,避免因语义偏差导致误判。 |
重排返回条数 | 前 3–5 条 | 提升最终结果的相关性,减少模型处理无关信息的负担。 |
MAX_TOKENS | 2048–4096 | 适应医学报告的详细程度,确保上下文完整输入给大语言模型。 |
解析超时时间 | 600 秒 | 处理大型或复杂 PDF 文档解析可能耗时较长的情况。 |
容易做错的三处
- AI 对话节点输出结果为空,原因可能是提示词中引用的变量名与实际传入的变量名不一致,或变量值在传递过程中未正确赋值。
- 知识库搜索结果条数不符合预期,可能是因为知识库搜索节点的
相似度阈值设置过高,导致相关文档被过滤。 - 工作流在特定患者数据处理时出现超时错误,这通常是由于
解析超时时间设置不足,无法处理包含大量图片或复杂表格的医学报告。
怎么确认配好了
- 选取多份真实 DTP 药房患者数据,运行工作流,核对预筛结果与人工判断的一致性。
- 检查工作流日志,确认每个节点的数据输入与输出符合预期,特别关注知识库搜索的
召回条数和相似度阈值是否有效。 - 验证敏感患者信息在工作流处理过程中是否得到正确脱敏或加密,符合隐私保护要求。
- 模拟高并发场景,测试工作流的稳定性及在
解析超时时间内完成任务的能力。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。