风电投研知识库建设的引用来源与溯源

风电投研数据主要来自风机厂商公开技术手册、电网调度公开运行数据、第三方行业研究报告、气象观测站点公开数据集。数据更新节奏差异较大,厂商技术文档随新品迭代更新

这个品类的数据长什么样

风电投研数据主要来自风机厂商公开技术手册、电网调度公开运行数据、第三方行业研究报告、气象观测站点公开数据集。数据更新节奏差异较大,厂商技术文档随新品迭代更新,行业报告按季度或年度发布,电网运行数据为小时级更新。文档结构多包含风机额定参数、项目运维台账、电价测算表格、政策条款片段,字段包含有功功率、风速、轮毂高度等,对应单位分别为MW、m/s、米。

这些特征在「引用来源与溯源」这一环带来什么约束

风电投研数据的多源更新节奏差异,要求引用溯源链路区分静态文档与动态数据的溯源逻辑,避免将实时电网数据与年度行业报告的溯源规则混淆。文档包含结构化表格与非结构化文本,溯源需精准定位表格行、参数条目,仅匹配文档片段无法满足溯源需求,增加了元数据提取的复杂度。风电投研常涉及跨文档的参数对比,溯源需关联同一项目的多份文档条目,进一步提升了溯源的关联难度。同时,字段单位统一要求高,未标注单位的溯源信息可能导致投研结论出现数值混淆。

配置怎么定

配置项建议取法这样取的依据
引用内容模板`{doc.content}\n来源:{doc.source}段落位置:{doc.paragraph_num}更新时间:{doc.update_time}`风电投研参数易随机型迭代变化,需明确标注来源与更新时间,避免跨源数据混淆
召回条数前8-12条风电投研需对比多台风机参数、多个项目数据,足够的召回量覆盖对比需求,同时避免冗余
相似度阈值0.75-0.85风电参数多为标准化数值,阈值过低易引入无关的运维日志或政策文本,过高则可能遗漏同型号风机的不同批次参数
PARSE_FILE_TIMEOUT_SECONDS600 秒风电厂商手册常包含多页结构化表格,解析耗时较长,避免因超时截断文档内容导致溯源缺失
重排返回条数前5条风电投研核心参数集中,重排后优先返回最相关的权威来源,简化溯源链路

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:AI回复中混用了知识库引用内容与自定义提示词的生成内容。原因:未区分引用内容模板与对话提示词的配置边界,导致溯源信息被自定义内容覆盖。
  • 现象:配置变量引用时无可选值。原因:未在知识库绑定的上下文变量节点中配置对应参数,或变量未通过上游节点输出传入检索链路。
  • 现象:线上环境触发Cannot redefine property: toString报错。原因:自定义脚本中重复定义了toString方法,与FastGPT内置原型链方法冲突。

怎么确认配好了

  • 发起包含风电核心参数的检索请求,检查返回结果的引用栏是否包含文档来源、段落位置与更新时间信息。
  • 调整相似度阈值后发起多次检索,验证召回结果的相关性符合预期阈值范围。
  • 上传一份风电厂商技术手册,查看解析后的文档片段是否保留了参数字段与对应单位。
  • 查看检索日志,确认每条召回结果都关联了正确的文档元数据。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。