这个品类的数据长什么样
中药投研数据主要来自《中华人民共和国药典》、中药材种植基地监测报告、上市药企研发文档、行业研报与临床研究文献。数据更新节奏因来源不同存在差异,药典类每5年更新一次,企业内部研发文档随项目进度实时更新,行业研报按季度发布。文档结构包含结构化表格(如成分含量表)、流程型长文本(炮制规范)、标准化字段,字段涉及药材学名、性味归经、有效成分含量,单位多为mg/g、%或g/100g,部分文档附带批次编号与产地信息。
这些特征在「文档解析与分块」这一环带来什么约束
药典类文档的固定格式要求解析工具保留表格结构与字段对应关系,避免成分数据错位;有效成分含量的数值与单位绑定,分块时需确保单位不被拆分至相邻块。长文本类炮制流程文档存在大量专业术语与步骤关联,分块长度需适配术语组合长度,避免割裂操作逻辑。批次与产地字段多嵌入文档边角或备注栏,解析时需优先提取结构化字段,防止被长文本内容覆盖。部分研报附带图表数据,需额外处理图表转文本的适配逻辑,避免丢失含量对比信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_TABLE_ENABLE | 开启 | 中药投研文档包含大量成分含量表、炮制流程表,需保留表格结构与字段对应关系 |
CHUNK_SIZE | 800–1200 字符 | 中药专业术语密集,过长分块会导致上下文逻辑断裂,过短则拆分专业关联内容 |
CHUNK_OVERLAP | 100–150 字符 | 保留专业术语的前后关联,避免割裂炮制步骤或成分对比逻辑 |
PARSE_IMAGE_OCR_ENABLE | 开启 | 部分行业研报附带成分对比图表,需通过OCR提取图表内的数值与单位信息 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 适配中药投研场景下批量种植数据、药典合集类大文件上传需求 |
PARSE_TIMEOUT_SECONDS | 300 秒 | 大体积的药典合集文档解析耗时较长,避免解析过程超时中断 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:传入外部链接后解析结果为空,界面显示解析成功但无有效文本内容,针对FastGPT v4.8.13及以上版本的该问题较为常见。原因:未针对中药文档的结构化表格与专业术语格式配置对应解析规则,导致解析工具无法提取有效信息。
- 现象:自定义分块后的文档存入知识库后,重复内容被自动删除,导致自定义分块顺序与索引不匹配。原因:未关闭知识库的自动去重功能,或未正确配置
SKIP_DUPLICATE_CHUNK参数。 - 现象:解析任务失败,日志显示
ETIMEDOUT错误。原因:未将PARSE_TIMEOUT_SECONDS调整至适配大体积药典合集文档的取值,导致解析过程超时中断。
怎么确认配好了
- 上传一份药典中的成分含量表格文档,查看解析结果是否保留完整的表格结构与字段对应关系。
- 上传一份包含完整炮制流程的长文本文档,检查分块是否保留步骤逻辑,未割裂专业关联内容。
- 上传一份附带成分对比图表的研报文档,确认OCR解析后是否提取了图表内的数值与单位信息。
- 上传两份内容一致的中药文档,核对知识库自动去重规则是否按配置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。