这个品类的数据长什么样
储能相关数据主要来自产品研发文档、并网合规文件、营销推广物料、行业技术白皮书。更新节奏随新产品上线、政策调整不定期变化,单次更新的文档体量从单页参数表到数十页合规手册不等。文档多以层级化markdown或PDF格式存在,包含产品型号、额定充放电容量、转换效率、安装尺寸、认证编号等字段,字段附带标准单位,如kWh、kW、%、mm。
这些特征在「知识库检索与召回」这一环带来什么约束
储能品类的参数字段多且带单位,检索时需精准匹配单位避免歧义;层级化的文档结构要求保留从属关系,否则无法按产品分类召回;更新频率不固定,需定期同步最新数据;单份文档体量差异大,需适配不同长度的文本解析。这些特征会导致通用配置无法满足需求,需要针对性调整解析、召回、同步等环节的参数。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
parse_chunk_size | 800–1200 字符 | 储能文档包含长串参数与层级内容,该分段长度可平衡参数完整性与检索精度 |
recall_top_k | 前 8–12 条 | 储能产品参数条目较多,过多召回会导致结果冗余,该范围可覆盖核心检索需求 |
similarity_threshold | 0.72–0.85 | 储能参数匹配需较高精度,该阈值可过滤低相关的非目标参数内容 |
parse_keep_markdown_structure | 开启 | 储能文档多带有层级标题与分类,保留结构可避免从属逻辑丢失 |
refresh_cron | 0 0 */3 * * ? | 储能新产品与政策更新频繁,每3天刷新可保证数据时效性 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 部分储能合规手册与技术白皮书体量较大,该上限可覆盖常规上传需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:导入储能的markdown文档后,标题层级丢失,无法按产品大类检索子型号内容。原因:未开启保留markdown结构的解析配置,分段时丢弃了标题与内容的从属关系。
- 现象:检索结果中储能参数的数字与单位之间出现多余空格,知识库录入时无空格。原因:解析时默认启用了自动格式化开关,对数字与相邻字符添加了空格补全。
- 现象:上传Excel格式的储能产品参数表后,提取的字段为空或格式混乱。原因:未启用知识库的Excel解析配置,或未配置字段提取映射规则。
怎么确认配好了
- 上传一份带有层级标题的储能markdown文档,检查解析后的分段是否保留了标题与对应内容的从属关系。
- 输入储能参数关键词,检查检索结果中数字与单位之间的格式是否与录入时一致。
- 上传Excel格式的储能参数表,检查是否能正确提取产品型号、额定容量等预设字段。
- 手动触发知识库刷新,检查更新后的新产品参数是否能被正常检索到。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。