这个品类的数据长什么样
注册申报涉及的药物警戒数据主要来源于临床试验报告、上市后监测数据、安全性更新报告(PSUR/PBRER)、个例安全性报告(ICSR)、文献检索结果以及监管机构发布的指南和要求。这些数据通常以结构化(如数据库记录、XML文件)和非结构化(如PDF文档、Word报告、图片扫描件)混合的形式存在。更新频率方面,临床试验数据随试验进展定期汇总,上市后数据则持续收集,安全性更新报告通常按半年、年度或更长周期提交。文档结构复杂,例如ICSR报告包含患者信息、药品信息、不良事件描述、医学判断等多个字段,PSUR/PBRER则涵盖汇总数据、信号检测结果、风险效益评估等章节。字段内容多样,涉及医学术语、药品通用名/商品名、剂量单位(如 mg, IU)、时间单位(如天、周、月)、以及不良反应的编码(如MedDRA)。
这些特征在「工作流编排」这一环带来什么约束
注册申报数据的多样性和复杂性对工作流编排提出了具体要求。结构化数据需要精确的字段映射和数据清洗,以确保信息在不同系统间的准确流转。非结构化文档的解析则依赖于高级的自然语言处理(NLP)能力,例如从PDF报告中提取关键信息,这要求工作流能集成文档解析节点。数据的更新频率决定了工作流的触发机制,例如对于定期提交的安全性报告,可配置定时任务触发工作流,而ICSR则可能需要实时或近实时触发。MedDRA等专业编码体系的应用,意味着工作流在处理不良事件描述时,需要具备术语标准化和编码校验的能力。此外,监管合规性要求所有数据处理步骤可追溯,工作流日志记录需详尽。文档结构复杂性则要求工作流能够处理多层级的文档解析和信息抽取,并支持条件分支以应对不同类型报告的处理逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 3000-5000 字符 | 确保LLM能处理注册申报文档中较长的段落,避免关键信息丢失。 |
分段长度 | 800-1200 字符 | 平衡分段粒度,保证每个分段包含足够上下文,同时避免过长导致模型处理效率降低。 |
召回条数 | 前 5 条 | 聚焦于最相关的文档片段,减少不必要的背景信息,提高检索效率。 |
相似度阈值 | 0.75-0.85 | 筛选出与查询高度相关的文档内容,排除噪音,特别是医学术语的精确匹配。 |
重排返回条数 | 前 3 条 | 在召回的基础上进一步优化排序,确保最核心的信息优先呈现。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 考虑到注册申报文档(如PSUR)可能包含大量页面,预留充足的解析时间。 |
容易做错的三处
- LLM节点返回
chat:LLM_model_response_empty:通常是由于输入提示词或上下文过长,超出模型处理能力,或者模型内部错误导致。 - 布尔判断节点结果与预期不符:现象是节点一输出为
true,但连接的判断器却显示false。这可能是因为节点一的输出类型与判断器预期的类型不一致,例如字符串"true"与布尔值true的差异。 - 工作流出现
Error: Timeout报错:这可能是由于文件解析、API调用或数据库查询耗时过长,超出工作流或节点设定的最大等待时间。
怎么确认配好了
- 针对关键信息抽取任务,使用不同类型的注册申报文档(如ICSR、PSUR)进行测试,核对抽取结果与原文内容的一致性。
- 模拟异常数据输入(如缺失字段、格式错误),验证工作流的错误处理机制是否按预期触发,并记录错误信息。
- 检查工作流日志,确认每个节点的执行状态、输入输出以及持续时间,确保没有意外的超时或失败。
- 使用包含特定医学术语和编码(如MedDRA代码)的测试集,验证工作流在术语标准化和编码匹配方面的准确性,并根据业务需求调整阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。