这个品类的数据长什么样
个护用品的投研数据主要来源于国家药监局备案文件、品牌官方技术白皮书、电商平台产品详情页、第三方成分检测报告。数据更新节奏随新品上市、合规政策调整不定期触发,无固定周期。文档类型包含结构化成分表格、长文本使用说明、合规性声明与合规备案附件,字段涵盖成分名称、浓度占比、单次使用量、保质期、备案编号等,单位涉及百分比、毫升、克、月等。
这些特征在「文档解析与分块」这一环带来什么约束
结构化成分表格占比高,需精准识别单元格关联关系,避免拆分跨单元格的成分说明;长文本使用说明存在重复场景描述,分块需保留上下文逻辑链;带精确单位的浓度、使用量字段,需避免截断数值与单位的绑定关系;合规备案文件的段落结构严谨,分块不能破坏条款的完整语义。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 个护文档包含长文本成分说明与表格片段,该区间可平衡语义完整性与召回密度 |
chunk_overlap | 100–150 字符 | 保留跨分段的成分关联信息,避免拆分连续的使用场景描述 |
parse_table_format | markdown_table | 精准提取结构化成分表格,保留单元格层级关系 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 适配多页备案文件与长文本技术文档的解析时长 |
enable_unit_aware_split | 开启 | 避免截断带单位的浓度、使用量字段,保留数值与单位的绑定关系 |
max_table_cell_length | 2000 字符 | 容纳长文本的成分说明单元格,避免提前截断内容 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传备案文件后解析节点显示超时状态,日志返回
ETIMEDOUT错误。原因:未调整PARSE_FILE_TIMEOUT_SECONDS参数,默认值不足以处理多页合规文档的解析流程。 - 现象:成分表格仅抓取前3行数据,后续行内容缺失。原因:未设置
max_table_row参数(或默认值过低),未放开表格行数限制。 - 现象:解析后的分段中,浓度数值与百分比单位被拆分到不同分段。原因:未开启
enable_unit_aware_split配置,默认分块逻辑未绑定数值与单位关联。
怎么确认配好了
- 上传一份包含完整成分表格的个护产品备案文件,查看解析后的文本是否完整保留所有表格行与单元格内容。
- 选取一段包含浓度数值与单位的长文本,检查分段结果是否保留数值与单位的绑定关系。
- 上传一份超过10页的品牌技术白皮书,确认解析任务未触发超时报错。
- 查看系统参数配置页面,确认
enable_unit_aware_split处于开启状态。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。