这个品类的数据长什么样
医药电商的质量文档主要包括药品、医疗器械、保健品等商品的注册证、生产许可证、经营许可证、检验报告、产品说明书、不良反应报告、GSP(药品经营质量管理规范)认证文件以及供应商资质证明等。这些文档多以 PDF 格式存在,部分为扫描件,结构相对固定,例如药品说明书通常包含【药品名称】、【成分】、【适应症】、【用法用量】、【不良反应】等标准章节。数据来源以国家药监局数据库、企业内部管理系统、第三方检测机构报告为主。更新频率因文档类型而异,注册证、许可证类文件有固定有效期和复审周期,而产品说明书、不良反应报告可能根据监管要求或实际情况进行不定期更新。字段与单位严格遵循药监部门规定,例如药品剂量单位(mg、g、ml)、批号、有效期等。
这些特征在「文档解析与分块」这一环带来什么约束
医药电商质量文档的固定结构和严格字段要求,对文档解析的准确性提出高要求。扫描件的存在意味着需要具备高质量的 OCR 能力,以确保文本内容的完整提取。文档中可能包含大量表格和图片(如药品包装图、化学结构式、检验图谱),解析时需保留其上下文关联,避免信息丢失或误解。特别是对于产品说明书和检验报告,其中的关键参数、剂量、不良反应描述等,必须精确无误地分块,才能在后续的问答或检索中被准确召回。更新频率不一的特点,要求知识库能够支持增量更新和版本管理,避免因文档变更导致知识过时。字段和单位的标准化,使得在分块时可以利用预设规则进行结构化信息提取,提高召回效率。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 100 MB | 质量文档可能包含大量图片或扫描件,文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 大型 PDF 文件或扫描件的 OCR 解析耗时较长,需要足够的处理时间。 |
分段长度 | 800–1200 字符 | 保证单段信息完整性,同时适应大模型输入窗口,尤其适用于说明书章节内容。 |
分段重叠长度 | 100–200 字符 | 确保上下文连续性,避免因分段截断导致语义缺失。 |
启用图片识别 | 是 | 质量文档常包含图表、化学结构式,图片内容对理解至关重要。 |
表格解析模式 | 结构化提取 或 Markdown | 检验报告等文档包含大量表格数据,需保留表格结构。 |
容易做错的三处
- 上传 PDF 文件后,解析状态长时间显示“处理中”或直接失败。这通常是由于 PDF 文件体积过大或内容复杂(如大量扫描图片),导致
PARSE_FILE_TIMEOUT_SECONDS设置过短,处理未完成即超时。 - 知识库问答时,关于药品剂量、不良反应等关键信息出现遗漏或不准确。原因在于文档解析时未充分考虑表格或图片内容,导致结构化信息提取不完整,或
分段长度过长使得关键信息被稀释。 - 知识库无法解析某些外部链接的文档,提示“不支持的链接类型”。这通常是由于链接指向的是需要登录验证、动态生成或非标准格式的网页内容,知识库仅支持公开可访问的静态网页链接。
怎么确认配好了
- 选择有代表性的药品说明书、检验报告等文档进行上传解析,检查解析后的分段内容是否完整,尤其是表格和图片对应的文本描述。
- 针对文档中的关键信息(如特定药品的用法用量、不良反应列表),通过知识库进行提问,验证相关分段是否能被准确召回并用于回答。
- 上传一个包含扫描件的质量文档,确认 OCR 识别的文本内容准确性,尤其是批号、有效期等关键字段的识别无误。
- 尝试上传一个超出
UPLOAD_FILE_MAX_SIZE或预期解析耗时较长的文件,观察系统是否给出明确的错误提示或超时信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。