这个品类的数据长什么样
大气治理相关收益率数据主要来自环保监测站点的实时污染物数据、企业治理项目的运营台账及第三方碳交易与排污权交易平台的收益记录。数据更新节奏分为小时级实时监测值与日度汇总报表两类,文档结构以单项目为单位,包含监测点位编码、污染物浓度、治理能耗、减排量、项目投入、运营成本、交易收益等字段。浓度单位为μg/m³,能耗单位为kWh,减排量单位为吨,成本与收益单位为元。多数配套文档以结构化CSV与Markdown日报格式存储。
这些特征在「表单与交互」这一环带来什么约束
该品类的多粒度数据、多字段单位与关联属性,对表单与交互环节带来多重约束。需支持小时级与日度数据的切换筛选,匹配不同业务场景的查询需求。多单位字段需自动适配显示规则,避免用户手动转换单位产生误差。关联字段如减排量与对应污染物浓度需做联动校验,确保数据逻辑自洽。同时,因配套文档多含Markdown格式的层级化日报,交互环节需保留文档内的标题从属关系,避免知识库检索时丢失数据逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_MARKDOWN_HEADING_LEVEL | 2–6 | 大气治理日报的Markdown文档多以二级标题作为项目分类,三级及以下为细分数据项,保留2-6级可完整还原层级逻辑,避免丢失从属关系 |
RECALL_FIELD_WHITELIST | ["治理项目ID","污染物浓度","减排收益","运营成本"] | 该品类核心查询场景围绕收益率相关字段,限定召回字段可减少无关数据返回,提升检索精准度 |
SIMILARITY_THRESHOLD | 0.72–0.85 | 大气治理数据字段关联性强,阈值过低会引入无关数据,过高则可能遗漏匹配的细分项目数据,需按实际业务场景实测标定 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 单份大气治理日度汇总文档含多项目数据,解析耗时较长,600秒可覆盖多数文档的完整解析流程 |
ENABLE_CHAT_DIRECT_TRIGGER | 开启 | 业务场景需实时响应收益率查询,无需用户手动触发交互按钮,提升使用效率 |
MODEL_SELECTION_WHITELIST | ["通义千问","文心一言","星火大模型"] | 该品类数据需支持中英文文献引用,国内大模型适配国内数据源与术语更贴合,需限定可选范围避免兼容性问题 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:知识库检索时无法还原Markdown文档的标题从属关系,数据逻辑混乱。原因:未正确配置
PARSE_MARKDOWN_HEADING_LEVEL参数,仅保留一级标题或未开启Markdown层级解析。 - 现象:用户需手动点击交互按钮才能发起查询,无法直接输入提问触发响应。原因:未开启
ENABLE_CHAT_DIRECT_TRIGGER配置项,交互模式被限定为按钮触发。 - 现象:中文提问无法检索到知识库内的英文文献数据。原因:未配置支持中英文跨语言检索的参数,或召回字段未包含英文文献的标题与摘要字段。
怎么确认配好了
- 上传一份标准大气治理Markdown日报,检查知识库检索结果是否保留标题与细分数据的从属关系,确认
PARSE_MARKDOWN_HEADING_LEVEL配置生效。 - 直接输入包含“某项目收益率”的中文提问,无需点击交互按钮,检查是否自动触发响应并返回匹配数据,确认
ENABLE_CHAT_DIRECT_TRIGGER配置生效。 - 尝试选择国内大模型作为调用载体,检查是否出现在可选列表中,确认
MODEL_SELECTION_WHITELIST配置正确。 - 输入中文提问并指定查询英文文献,检查是否能检索到知识库内的英文文献数据,确认跨语言检索配置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。