这个品类的数据长什么样
药物警戒领域的数据主要来源于药品上市后监测报告、临床试验报告、文献资料、以及患者自发报告。这些数据更新频率高,尤其是在新药上市初期,不良事件报告可能呈爆发式增长,需要实时处理。数据文档通常包含结构化和非结构化信息。结构化数据包括患者基本信息、药品信息(如药品名称、批号、剂量、用法)、不良反应事件(如 MedDRA 编码、发生时间、严重程度)、结局等。非结构化数据则表现为详细的临床描述、医生诊断记录、患者主诉等自由文本。字段方面,可能涉及 ICD-10 疾病编码、ATC 药品分类码等行业特定标准。单位上,剂量常以毫克(mg)、克(g)计,时间以小时(h)、天(d)计,频率以次/日、次/周等表示。
这些特征在「工作流编排」这一环带来什么约束
高频次的数据更新要求工作流具备实时或近实时的数据摄取能力,以便及时发现潜在的安全信号。结构化与非结构化数据并存的特点,使得工作流必须集成文本解析、实体识别和知识图谱构建等组件,实现对自由文本的有效抽取和结构化。例如,从患者自发报告中识别药品名、不良反应症状和时间关联。行业特定编码和单位的使用,要求工作流中的数据转换模块能准确映射和标准化这些信息,避免因数据格式不一致导致分析错误。同时,这些数据通常涉及高度敏感的患者隐私,工作流设计需严格遵循数据脱敏和合规性要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000–12000 token | 确保 AI 对话能够涵盖不良反应报告的完整上下文,避免信息丢失。 |
分段长度 | 500–800 字符 | 平衡分段粒度与语义完整性,提高知识库检索的准确性。 |
召回条数 | 前 5–7 条 | 兼顾检索效率与相关性,保证核心信息被召回。 |
相似度阈值 | 0.75–0.85 | 过滤掉低相关性文档,聚焦于与查询最匹配的不良反应信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 300–600 秒 | 考虑到不良反应报告可能包含大量文本,预留充足时间完成文件解析。 |
maxRetry | 3 次 | 应对外部 API 调用(如 MedDRA 编码服务)的瞬时网络波动或服务不可用情况。 |
容易做错的三处
- AI 对话模块的输出未能被后续组件捕获,导致工作流中断或数据丢失,原因在于未正确配置输出变量或后续组件的输入映射。
- 工作流执行过程中出现“Cannot convert undefined or null to object”错误,通常是由于某个前置模块的输出为空或未定义,而后续模块期望非空输入。
- 知识库检索结果未正确传递给 HTTP 请求或 AI 对话模块,导致 AI 无法引用相关知识,原因在于数据格式不匹配或参数字段名不一致。
怎么确认配好了
- 通过模拟提交不同类型的不良反应报告,观察工作流是否能准确解析出药品名称、不良反应症状和时间等关键实体。
- 检查工作流日志,确保所有模块均成功执行,没有出现错误或警告信息,特别是数据转换和外部 API 调用步骤。
- 验证 AI 对话模块输出的内容是否准确引用了知识库中的相关信息,并能根据不良反应报告生成符合预期的安全评估建议。
- 核对最终输出的结构化数据,确保 MedDRA 编码、ICD-10 编码等行业特定字段的映射准确无误,且单位一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。