这个品类的数据长什么样
焦煤财报数据主要来自境内外交易所公开公告、煤炭行业协会月度/季度统计报告、上市煤企年度及季度报告。数据更新节奏固定,季度财报每季度末后30日内发布,年度财报次年4月前发布,临时公告随行业供需变动即时更新。文档多为PDF格式,结构包含核心经营数据章节,字段涵盖焦煤干基灰分、硫分、粘结指数、产量、销量、含税出厂价等,单位多为百分比、吨、元/吨。
这些特征在「知识库检索与召回」这一环带来什么约束
固定的更新节奏要求知识库同步周期匹配财报发布节点,避免检索到过期数据。专业细分的指标字段需要检索系统精准匹配术语,避免泛化检索混入无关品类数据。长文档结构要求分段处理时保留指标完整性,避免拆分破坏专业表述。多来源数据需按焦煤专属分类做元数据绑定,确保检索范围限定在目标品类内。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
元数据过滤规则 | 按「行业分类=焦煤」「财报类型=季报/年报」过滤 | 焦煤财报需严格限定品类与报告周期,过滤后仅召回目标范围内的知识库内容 |
召回条数 | 前8-12条 | 焦煤财报包含多组专业数据,足够的召回量可覆盖完整分析所需的上下文 |
相似度阈值 | 0.75-0.82 | 专业术语匹配精度要求较高,避免召回低相关的非焦煤财报内容 |
分段长度 | 800-1200字符 | 焦煤财报的专业指标常集中在连续段落,该长度可避免拆分破坏指标表述完整性 |
PARSE_FILE_TIMEOUT_SECONDS | 300秒 | 单份年度财报PDF解析耗时较长,避免因超时导致解析失败 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 适配单份完整年报PDF的常见文件体积 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:检索结果混入钢铁、电力等其他品类的财报数据。原因:未配置
元数据过滤规则,或过滤条件未绑定焦煤专属分类字段。 - 现象:检索返回的分段内容丢失焦煤专属专业指标(如粘结指数)。原因:
分段长度设置过短,拆分时破坏了指标所在的完整语句。 - 现象:基于知识库创建的应用仅能召回知识库内容,无法调用模型支持的联网搜索功能。原因:未关闭应用的强制知识库检索开关,或未启用联网权限配置。
怎么确认配好了
- 上传一份焦煤上市公司的财报PDF,检查解析后文档的元数据是否包含预设的行业分类与财报类型字段。
- 发起包含焦煤专业术语的检索请求,检查返回结果是否仅包含焦煤相关财报内容,无其他品类数据。
- 查看检索结果的分段内容,确认专业指标未被拆分至不同段落。
- 测试应用在知识库无匹配数据时,是否触发联网搜索流程。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。