这个品类的数据长什么样
教育服务智能尽调报告的数据来源包括教育机构的办学资质备案文件、课程研发文档、运营台账、师资资质证明、合规自查报告等。更新节奏随文档类型不同有所区分,资质类文件按年度更新,运营类台账按月度或季度更新,课程文档每学期更新。文档包含结构化表格、长文本说明、扫描版资质文件等类型,字段涉及机构编号、师资资质等级、课程课时、营收明细等,单位包含课时、万元、人数等。
这些特征在「文档解析与分块」这一环带来什么约束
结构化表格占比高,需保留单元格与对应内容的关联,避免打散后字段信息丢失;长文本类的课程说明、合规报告需按语义段落分块,硬分割会破坏内容逻辑连贯性;扫描版资质文件、师资证明图片占比不低,需启用高精度文字识别功能,否则无法提取图片内嵌信息;不同更新节奏的文档需匹配对应解析触发规则,确保最新版本内容被优先处理;字段含特定单位(如课时、万元),需保留字段与单位的绑定关系,避免向量化时信息缺失。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 开启 | 尽调报告包含大量扫描版资质文件、师资证明图片,需识别图片内嵌文字 |
PARSE_TABLE_PRESERVE_STRUCT | 开启 | 结构化表格占比高,需保留单元格与对应内容的关联,避免字段信息丢失 |
CHUNK_SIZE | 800–1200 字符 | 长文本类课程说明、合规报告需按语义分块,该区间适配多数教育服务文档的逻辑段落长度 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 大型运营台账、多页课程大纲文档解析耗时较长,避免因超时中断解析 |
CHUNK_OVERLAP_RATE | 10% | 确保长文本分块的语义连贯性,避免关键信息被分割在相邻块的边界处 |
UPLOAD_FILE_ALLOWED_EXT | pdf,docx,xlsx,image/png,image/jpeg | 覆盖资质备案文件、办公文档、扫描件等教育服务尽调的常见文档类型 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传Excel格式的运营台账后,向量化索引中字段与内容对应关系混乱,原因是未开启
PARSE_TABLE_PRESERVE_STRUCT配置,将表格单元格内容打散为无关联的零散文本。 - 扫描版办学资质PDF上传后,解析结果无有效文字内容,原因是未启用
PARSE_OCR_ENABLE配置,未触发图片文字识别流程。 - 通过API上传文档后,生成的分块长度与预期不符,原因是未在API请求参数中指定
CHUNK_SIZE,使用全局默认配置导致与文档长度不匹配。
怎么确认配好了
- 上传一份扫描版资质文件,查看解析后的文本内容,确认图片内嵌文字已被成功识别。
- 上传一份Excel格式的师资花名册,查看分块后的内容,确认单元格与对应内容的关联未被破坏。
- 通过API上传文档时,检查请求参数中是否包含自定义的分块与解析配置项,确认参数已正确提交。
- 查看知识库的分块列表,核对分块的长度与预设配置是否匹配。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。