这个品类的数据长什么样
药物警戒的数据核心围绕药品不良反应(ADR)报告、风险管理计划(RMP)、产品说明书以及相关的法规文件展开。数据来源包括临床试验数据、上市后监测数据、全球药品不良反应数据库、医学文献等。其更新频率受法规要求和事件驱动,例如新的不良反应事件、安全性信号或法规修订。文档结构通常高度规范,如 ICH E2B 报告格式、欧盟 PSUR 模板,包含患者信息、药品信息、不良反应描述、结局等结构化字段,以及医学专业术语、剂量单位(如 mg、IU)、频率单位(如 次/日)等。
这些特征在「工具调用与插件」这一环带来什么约束
药物警戒数据的规范性与高敏感度,要求在工具调用时必须严格遵循数据隐私与安全规范,尤其是在处理患者相关信息时。其高度结构化的特性,使得调用外部工具进行数据抽取、转换和加载(ETL)时,需要精确匹配字段,避免信息丢失或错位。例如,从非结构化报告中提取 MedDRA 编码或 WHO-DD 编码时,对术语的识别精度是关键。更新频率上的事件驱动模式,意味着工具需要支持实时或近实时的触发机制,以便在新数据产生时立即启动分析流程。此外,多语言和跨区域的法规差异,也要求工具在处理不同国家或地区的文档时,能够灵活适应其特定的格式和术语要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 50 MB | 药物警戒报告常包含详细信息,单文件大小可能较大,兼顾上传效率与存储成本。 |
maxContext | 3000 Tokens | 确保能够涵盖一份典型不良反应报告的核心内容,保证上下文完整性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂 PDF 或扫描件时,解析耗时可能较长,预留充足时间避免超时。 |
分段长度 | 500 字符 | 保证每个分段能包含一个完整的医学概念或事件描述,提高召回准确性。 |
召回条数 | 前 8 条 | 药物警戒相关性要求高,适当增加召回数量,覆盖潜在关联信息。 |
相似度阈值 | 0.75 | 严格控制相似度,确保召回结果与医学术语和事件描述高度匹配。 |
容易做错的三处
- 调用大模型时出现
common:code_error.e或unAuthApiKey:通常是 API Key 配置错误或授权范围不足,导致无法访问模型服务。 - 模型配置中未启用
stream模式,导致调用只支持stream的大模型时报错:模型服务要求特定交互模式,未匹配会导致连接失败。 - PgVector 插件版本过低,无法支持新的向量化模型或索引功能:插件与核心系统的兼容性问题,导致数据存储或检索功能异常。
怎么确认配好了
- 上传一份典型不良反应报告,观察文件解析日志,确认文件内容能够被正确识别和分段。
- 针对报告中的关键医学术语进行检索,检查召回结果的相关性,确定
召回条数和相似度阈值是否合理。 - 通过调用插件执行特定数据抽取任务,例如提取
MedDRA编码,验证工具输出的字段与预期格式是否一致。 - 模拟高并发请求,监控系统资源占用及响应时间,确保配置能够支撑日常使用需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。