这个品类的数据长什么样
热力智能尽调报告的数据来源为热力运营管理系统、智能计量仪表后台、管网运维日志、属地监管报送报表。更新节奏为按抄表周期更新,常规为每小时或每日生成单条记录。单条文档为结构化条目,包含管网编号、供回水温度、压力、累计流量、抄表时间、关联设备ID、运维批次号等字段,供回水温度单位为℃,压力单位为MPa,流量单位为m³/h,每条记录绑定唯一的设备标识与抄表时间戳。
这些特征在「引用来源与溯源」这一环带来什么约束
热力数据的细粒度单条记录与多字段特征,要求溯源时需展示设备标识与抄表时间,避免引用内容模糊。按小时/日更新的特性,要求溯源系统需标记数据批次,防止重复引用历史记录。结构化字段多且关联设备唯一ID,要求解析时需精准提取字段,避免溯源信息缺失。批量上传的热力数据文件数量多、单条内容短,要求召回配置需平衡数量与精准度,防止上下文冗余或不足。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 | |||
|---|---|---|---|---|---|
召回条数 | 前8条 | 热力数据单条内容较短,8条可覆盖完整的管网工况上下文 | |||
相似度阈值 | 0.72–0.78 | 热力数据字段多且相似度判定需兼顾设备匹配与时间关联,阈值过低会引入无关记录 | |||
引用内容模板 | `{{source_name}} | 设备ID:{{device_id}} | 抄表时间:{{time}} | {{content}}` | 需展示热力数据的核心标识,便于溯源时快速定位具体记录 |
增量更新标记字段 | 抄表批次号 | 热力数据按运维批次更新,以批次号为标记可避免重复导入历史数据 | |||
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 结构化热力数据文件多为CSV或Excel格式,解析耗时中等,300秒可覆盖批量文件处理 | |||
去重规则 | 按设备ID+抄表时间 | 热力数据的唯一标识为设备与时间组合,该规则可彻底避免重复引用 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传批量热力数据文件后,知识库引用时出现重复溯源条目,原因是未配置按设备ID+抄表时间的去重规则,导致同一抄表记录被多次识别。
- AI对话组件选择变量引用模式后,温度设置按钮消失,无法调整生成参数,原因是未在系统设置中开启变量引用的高级参数配置开关。
- 引用内容弹窗中仅显示文件名,未展示设备ID与抄表时间,原因是引用内容模板未配置
device_id和time字段的占位符。
怎么确认配好了
- 上传单条结构化热力数据文件,查看知识库解析后的字段列表,确认
device_id、抄表时间等自定义字段被正确提取。 - 发起测试性查询,查看引用来源弹窗,确认展示的内容包含配置的模板字段。
- 上传同一设备的多条历史数据,检查知识库引用时是否自动去重,仅保留符合更新规则的记录。
- 调整
相似度阈值参数,发起多轮测试查询,验证召回结果的数量符合业务预期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。