这个品类的数据长什么样
普钢财报的数据主要来源于沪深交易所公开公告、上市公司季度报与年度报告、钢铁行业协会发布的月度统计数据。更新节奏随财报发布周期调整,季度报于每季度结束后1-2个月内更新,年报于年度结束后4个月内更新。文档结构以结构化财务表格为核心,搭配文字说明与行业对比分析,包含粗钢产量、吨钢毛利、原材料采购成本等字段,单位多为万吨、元/吨、千元/吨。
这些特征在「知识库检索与召回」这一环带来什么约束
普钢财报的结构化表格与长文本结合的特征,要求检索系统需同时支持字段级匹配与上下文关联分析。更新周期不固定且依赖公开披露节点,要求召回机制优先返回最新发布的财报数据,避免陈旧数据干扰分析结果。字段与单位的标准化程度较高,但不同公司的披露格式存在细微差异,需在检索时统一单位基准,避免因单位不匹配导致召回失败。长文档的分段需保留表格的完整性,否则会导致关键指标被拆分,无法支撑完整的财报分析逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 普钢财报包含结构化表格与长文本业务说明,分段需覆盖完整表格行或单段业务描述,避免拆分关键指标 |
overlap_ratio | 0.2–0.3 | 财报数据关联性强,重叠部分可保留跨分段的上下文关联,避免核心指标被拆分断裂 |
similarity_threshold | 0.75–0.85 | 普钢财报字段标准化程度高,需过滤低匹配度的无关文档,同时保留同品类细分数据的召回结果 |
rerank_top_k | 前 10 条 | 普钢财报涉及多维度指标(粗钢产量、吨钢毛利、原材料成本),重排可优先匹配核心业务问题的相关片段 |
parse_table_mode | structured_extract | 普钢财报包含大量标准化财务与生产数据表格,结构化解析可保留字段与单位的完整关联 |
max_context_tokens | 16000–24000 字符 | 普钢财报单文档长度可达数万字符,需保留足够上下文以支撑跨字段关联分析 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:检索时输入粗钢产量关键词,无法召回对应财报的表格数据。原因:未开启
parse_table_mode的结构化解析模式,表格内容被当作普通文本拆分,导致关键词无法匹配到完整的指标字段。 - 现象:检索结果条数远低于预期,无法覆盖全量财报与行业研报数据。原因:
similarity_threshold设置过高,过滤掉了大量相关的细分行业分析内容与财报附注信息。 - 现象:知识库同步后未更新最新季度财报数据。原因:
refresh_interval设置过长,未匹配普钢财报的季度发布节奏,导致旧数据未及时替换。
怎么确认配好了
- 上传单份已披露的普钢上市公司财报文档,进入知识库解析详情页,查看分段结果,确认表格内容未被错误拆分,字段与单位完整保留。
- 输入包含粗钢产量、吨钢毛利的组合检索词,查看召回结果的排序与匹配度,确认重排后的结果优先匹配核心业务需求。
- 手动触发知识库刷新,等待同步完成后检索旧财报与新财报的内容,确认最新数据已被正确召回。
- 调整
similarity_threshold的取值,对比不同阈值下的召回条数,确认符合业务所需的召回范围。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。