这个品类的数据长什么样
siRNA 核酸药的药物警戒数据主要来源于临床试验报告、真实世界研究(RWE)数据、上市后监测报告以及全球药品监管机构发布的安全性更新。这些数据通常以结构化(如数据库导出文件、CSV、Excel)和非结构化(如 PDF 格式的病例报告、医学文献、监管机构公告)形式存在。更新频率较高,特别是上市后监测,可能按季度或年度发布汇总报告,但个别严重不良反应报告则为即时更新。文档结构复杂,包含医学术语、剂量信息、用药途径、患者特征、不良事件描述、严重性评估、相关性判断等字段。其中,不良事件的标准化术语(如 MedDRA 编码)和剂量单位(如 mg/kg、µg/kg)具有专业性和特异性。
这些特征在「文档解析与分块」这一环带来什么约束
siRNA 核酸药不良反应数据的高更新频率要求解析系统具备高效的增量处理能力,以避免重复解析和资源浪费。文档结构的复杂性,特别是医学术语和编码的存在,使得简单的文本分块容易破坏语义完整性,例如将一个完整的不良事件描述或一个关键的 MedDRA 编码从其上下文中断开。此外,剂量和单位的特异性,如 mg/kg 或 µg/kg,要求分块策略能够识别并保留这些关键数值信息,防止其在切分过程中被截断或误解。非结构化 PDF 文档的表格和图表内容,特别是临床数据汇总表,对传统解析工具构成挑战,需要更智能的布局识别和数据抽取能力。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 保留完整不良事件描述、MedDRA 编码及上下文,避免关键信息被截断。 |
分段重叠长度 | 100–200 字符 | 确保上下文衔接,处理跨段落的复杂医学叙述和剂量信息。 |
文件类型白名单 | ['.pdf', '.csv', '.xlsx', '.txt'] | 覆盖常见的临床报告、监管文件和数据导出格式。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 适应大型临床试验报告或包含大量表格的 PDF 文档解析时间。 |
启用表格解析 | 是 | 抽取 PDF 和 Excel 中关键的剂量、不良事件汇总表数据。 |
召回条数 | 前 5–8 条 | 平衡召回率与后续大模型处理的上下文窗口限制,聚焦相关不良反应信息。 |
容易做错的三处
- 解析 Excel 文档时,大模型返回“不完整的命令或请求”提示,其现象是 Excel 文件未能被正确识别为数据表,而是被当作纯文本处理,导致模型无法理解其结构。原因在于解析器未能正确识别 Excel 文件的数据区域或表头,或未启用表格解析功能。
- 文档分块后,药物剂量或不良事件编码在检索结果中出现不完整或被截断,例如
20 mg/k,其现象是关键数值信息丢失。原因在于分段长度设置过短,未能将包含特定单位的数值信息作为一个整体保留。 - 上传大型 PDF 报告后,系统长时间无响应或报错超时,其现象是解析任务状态显示失败或停滞。原因在于
PARSE_FILE_TIMEOUT_SECONDS参数设置过低,不足以处理包含大量页面或复杂布局的报告。
怎么确认配好了
- 上传具有代表性的 siRNA 核酸药临床报告(PDF 格式),检查解析后的分块内容是否完整保留了不良事件描述、MedDRA 编码和剂量信息。
- 上传包含不良反应汇总数据的 Excel 文件,验证解析器能否正确识别并提取表格内容,且每个数据块的颗粒度能够满足后续查询需求。
- 针对解析后的知识库进行检索测试,使用包含特定剂量、不良事件名称或药品批次号的查询词,检查召回结果是否准确且上下文完整。
- 观察解析大型文档时的系统响应时间,确认任务能在
PARSE_FILE_TIMEOUT_SECONDS设定的阈值内完成,没有出现超时错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。