这个品类的数据长什么样
交易规则的数据主要来自金融机构官方业务公告、核心业务系统导出的规则文档、监管机构公示的合规文件。更新节奏随监管政策调整、业务流程迭代不定期变动,无固定周期。文档通常采用多章节结构,包含条款编号、适用场景、操作流程、例外说明,核心内容多以多列表格呈现,涉及字段包括交易代码、费率比例、生效日期、适用客户群体,单位涵盖百分比、时分、元/万元等。
这些特征在「文档解析与分块」这一环带来什么约束
交易规则的多章节、多列表格特征,要求解析环节需保留列与行的对应关系,避免表格内容错位。不定期更新的特性要求分块需保留完整的上下文关联,避免拆分生效日期与对应规则的绑定关系。多来源的文档格式差异,要求解析环节兼容PDF、Word等常见格式,同时需过滤无意义的格式辅助内容。长文档的结构层级要求分块需按章节层级拆分,避免跨章节的逻辑混乱。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 交易规则单条款含完整生效条件、操作流程,避免拆分核心关联信息 |
分段重叠 | 100–150 字符 | 保留相邻条款的上下文关联,避免跨条款查询时逻辑断裂 |
PARSE_TABLE_MULTICOLUMN | 启用 | 交易规则文档多包含多列费率表、交易时段表,需保留列与行的对应关系 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 长交易规则文档含多张表格,需预留足够解析时间 |
ENABLE_PARSE_IMAGE | 禁用 | 交易规则文档内图片多为格式装饰,无核心规则文本,减少无效存储 |
召回条数 | 前5–7条 | 交易规则查询通常需要关联1-2条相邻条款,合理覆盖关联信息 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:解析后的多列表格出现列错位、单元格内容跨列丢失。原因:未启用
PARSE_TABLE_MULTICOLUMN配置,未适配交易规则文档的多列布局。 - 现象:知识库召回结果无法关联生效日期与对应交易规则。原因:分段长度设置过小,拆分了生效日期与对应的条款内容。
- 现象:解析结果中出现大量无意义的图片文本条目,占用知识库存储空间。原因:未禁用
ENABLE_PARSE_IMAGE配置,误将交易规则文档内的格式辅助图片识别为核心内容。
怎么确认配好了
- 上传一份包含多列表格的交易规则测试文档,检查解析后的表格列对齐是否正常,确认多列表格解析配置生效。
- 选取包含生效日期与对应规则的段落,查看分块结果是否保留了完整的关联内容,确认分段参数设置合理。
- 查看知识库解析日志,确认未生成图片相关的解析条目,确认图片解析配置正确。
- 发起模拟查询,验证召回结果是否覆盖了相邻的关联条款,确认召回条数参数适配业务需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。