这个品类的数据长什么样
培养基与耗材的药物警戒数据主要来源于生产批次报告、质检报告、用户投诉、医学文献以及市场监管部门的通报。这些数据更新频率较高,部分批次报告与投诉可能每日都有新增。文档结构多样,包括结构化的数据库记录、半结构化的 PDF 批次报告、非结构化的用户反馈邮件或电话录音转写文本。字段与单位具有特异性,例如批号(BATCH_ID)、生产日期(PROD_DATE)、失效日期(EXP_DATE)、成分含量(如 mg/L 或 IU/mL)、特定杂质检测值(如 内毒素含量 (EU/mL))、以及不良事件描述(AE_DESCRIPTION)。投诉数据常包含图片或视频链接,而文献数据则以摘要和全文为主。
这些特征在「工作流编排」这一环带来什么约束
数据源的多样性要求工作流具备多源数据接入能力,特别是对非结构化文本的有效解析。高更新频率意味着工作流需要支持实时或近实时的触发机制,例如每小时检查一次新的投诉数据。文档结构的多变性对信息抽取提出了挑战,需要配置灵活的解析工具,以识别不同格式中的关键字段,例如从 PDF 中提取批号和生产日期。特异性的字段与单位要求在数据预处理阶段进行标准化和归一化,确保后续分析的准确性,例如将不同单位的成分含量统一转换为标准单位。此外,包含多媒体链接的数据需要工作流能够处理这些链接,并提取相关上下文信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
FETCH_INTERVAL_SECONDS | 3600 秒 | 应对较高更新频率,每小时检查新数据 |
PARSE_FILE_TYPE_LIST | ['pdf', 'txt', 'docx', 'eml'] | 覆盖常见的批次报告、投诉邮件和文献格式 |
CHUNK_SIZE | 800–1200 字符 | 兼顾文本语义完整性与后续模型处理效率 |
OVERLAP_SIZE | 100 字符 | 确保上下文连续性,避免切片丢失关键信息 |
EXTRACT_PATTERN_BATCH_ID | 正则表达式 | 精确识别不同格式报告中的 BATCH_ID 字段 |
SIMILARITY_THRESHOLD | 0.75 | 平衡召回率与准确性,避免无关信息干扰 |
容易做错的三处
- 工作流发布后,生成的免登录链接指向
http://localhost:3000/chat/,现象是外部用户无法访问。原因在于发布时未正确配置服务的外部访问地址,导致链接指向了本地开发环境。 - 在工具调用节点卡住,未返回结果或报错,例如数据库连接超时。现象是工作流执行日志显示工具调用节点长时间处于等待状态。原因可能是数据库连接参数
DB_CONNECTION_STRING配置错误,或数据库防火墙未开放 FastGPT 服务端的访问权限。 - 引用片段对应的原文件在线预览功能无法实现,或者预览内容不完整。现象是点击预览链接后显示空白页或部分内容缺失。原因在于知识库导入时,未将原始文件存储为可访问的路径,或文件切片时丢失了原始文件路径信息。
怎么确认配好了
- 通过上传不同格式(PDF、TXT、DOCX)的批次报告和投诉邮件,观察知识库中是否正确解析并切分了文本,检查切片内容是否包含关键字段如
BATCH_ID、EXP_DATE。 - 配置一个包含不良反应关键词(如“过敏”、“发热”、“失效”)的查询,对比召回结果是否包含与这些关键词相关的批次报告或投诉记录,并检查召回条数和相似度分数。
- 模拟一次新的用户投诉或批次报告更新,观察工作流是否在设定的
FETCH_INTERVAL_SECONDS时间内被触发,并成功处理了新数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。