这个品类的数据长什么样
医药电商平台在药物警戒方面的数据主要来源于用户在线提交的不良反应报告、商品评论、咨询记录以及药品销售与物流数据。这些数据通常以非结构化文本、半结构化 JSON 或结构化 CSV 格式存在。不良反应报告的更新频率较高,用户提交后通常需在数分钟内进行初步分类和处理。商品评论和咨询记录则随用户行为实时产生。文档结构方面,不良反应报告常包含患者基本信息、用药史、不良反应描述(症状、发生时间、持续时间、转归)、怀疑药品信息(名称、批号、用法用量)等字段。字段内容多为自然语言描述,涉及医学术语、口语化表达,甚至错别字。单位方面,剂量常涉及毫克(mg)、克(g)、毫升(mL)、片等,频率涉及次/日、周等。
这些特征在「工作流编排」这一环带来什么约束
医药电商的数据特征对工作流编排提出了特定要求。不良反应报告的实时性要求工作流能够快速响应,并支持高并发处理,例如将 maxContext 设置为较高值以避免队列积压。非结构化文本数据的比重意味着需要强依赖自然语言处理(NLP)节点进行信息抽取和实体识别,例如使用 JsonPath 从非结构化文本中提取关键医学实体。口语化表达和错别字的存在,要求 NLP 模型具备一定的鲁棒性,并可能需要引入纠错或标准化步骤。结构化数据的字段多样性,则需要工作流在数据清洗和转换环节具备灵活的映射能力。此外,药品批号等敏感信息的存在,对数据脱敏和权限控制节点提出了较高要求,确保数据流转过程中的合规性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 50 | 应对高并发不良反应报告提交,确保快速响应。 |
分段长度 | 800-1200 字符 | 兼顾不良反应报告的详细程度和模型处理效率,减少截断。 |
召回条数 | 前 10 条 | 确保相关背景知识(如药品说明书、历史同类报告)的覆盖度,辅助判断。 |
相似度阈值 | 0.75 | 筛选出与当前不良反应报告高度相关的历史数据,提高分类准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 留出足够时间处理复杂的药品说明书或附件中的非结构化数据。 |
重排返回条数 | 前 3 条 | 聚焦最关键的信息,减少工程师人工筛选成本。 |
容易做错的三处
- HTTP 请求节点在提取
http response中的 JSON 内容时,JsonPath表达式书写错误,导致下游节点接收到空值或错误数据。原因在于 JSON 结构复杂或表达式未能准确匹配目标字段。 - 日报流程中
base_url未正确配置,导致 AI 模型无法访问外部知识库或 API 服务。原因是没有仔细核对 API 服务的实际部署地址和端口。 - 工作流导出后在其他环境中无法正常运行,提示缺少 Python 依赖文件。原因在于导出时未包含所有自定义脚本或环境配置,导致目标环境缺少必要的运行组件。
怎么确认配好了
- 提交一份模拟不良反应报告,观察工作流日志,确认所有节点均成功执行,且
http response中的关键信息(如药品名称、不良反应类型)被正确提取。 - 在工作流中添加一个测试步骤,检查
base_url配置的外部 API 是否能成功返回数据,例如通过 ping 或简单的 GET 请求。 - 导出工作流并在一个全新的环境中导入运行,确认所有自定义 Python 脚本和背景知识都能被正确加载和调用,没有文件缺失或路径错误。
- 使用一组已知分类结果的测试数据,通过工作流进行处理,比对最终输出结果与预期分类的一致性,确认
相似度阈值和召回条数等参数设置合理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。