这个品类的数据长什么样
光伏智能尽调报告的数据主要来自三类渠道:光伏电站项目的备案验收文件、运维台账与并网结算数据、组件及逆变器厂商的产品参数手册。数据更新节奏分三类:备案文件仅在项目立项或变更时更新,运维台账按自然日每日同步,厂商产品参数随型号迭代不定期更新。文档结构包含结构化的项目台账、半结构化的尽调PDF报告,以及少量实时监控的时序数据文件。字段单位统一使用行业标准:装机容量以兆瓦峰(MWp)为单位,发电量以千瓦时(kWh)为单位,设备运行时长以小时为单位。
这些特征在「知识库检索与召回」这一环带来什么约束
光伏尽调数据的混合结构与更新差异,对检索召回带来多重约束。结构化台账与半结构化PDF的混合存储,要求检索系统同时支持字段精确匹配与语义召回,需分别适配两类文档的检索逻辑。不同数据源的更新节奏差异,要求召回逻辑优先调用近期更新的数据源,避免返回过时的厂商参数。长时序发电量文档的高token占比,需限制单条召回文档的分段长度,防止超出模型上下文窗口。统一的行业字段单位,要求检索结果需自动对齐单位标识,避免输出单位混淆的内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前3–5条 | 光伏尽调单条文档token数偏高,过多召回会超出模型上下文限制 |
相似度阈值 | 0.72–0.85 | 光伏专业术语密度高,需过滤低相关性的模糊匹配结果 |
分段长度 | 800–1200 字符 | 光伏尽调文档包含长时序数据,分段过长会割裂语义,过短会丢失上下文关联 |
重排返回条数 | 前2–4条 | 需在保留核心信息的前提下,控制最终输出的token总量 |
引用上限 | 1500–2000 字符 | 需匹配模型的上下文窗口上限,避免单轮回答token溢出 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 大型光伏尽调PDF解析耗时较长,需预留足够的解析时间 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:在V4.8.10-fix2版本中,知识库搜索结果直接输出到界面,后续AI回复重复展示检索内容。原因:未在工作流的知识库搜索节点中关闭「直接返回检索结果」的配置项,导致检索节点与AI生成节点同时输出内容。
- 现象:设置
引用上限为固定值后,单轮回答token数仍超出模型限制。原因:未结合单条文档的分段长度与召回条数计算总token,仅设置固定上限导致总token溢出。 - 现象:检索结果返回过时的厂商组件参数。原因:未配置按更新时间过滤的检索规则,召回了超出合理更新周期的旧版本文档。
怎么确认配好了
- 上传一份典型的光伏尽调文档,触发知识库检索,核对返回结果的文档更新时间是否符合预设的时间过滤规则。
- 调整
相似度阈值后,检索光伏专业术语,核对返回结果的相关性是否符合预期。 - 触发一次完整的工作流调用,查看返回的token消耗情况,调整相关配置项至符合模型的上下文限制。
- 检查检索结果的字段单位,确认是否自动对齐了行业标准单位标识。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。