这个品类的数据长什么样
化纤品类的财报数据来源包括沪深交易所披露的上市公司定期报告、中国化纤工业协会发布的行业运行数据、上游石化企业公开的原料报价信息。更新节奏分为固定周期:上市公司定期报告按季度、年度更新,行业数据按月度更新,原料报价按日更新。文档结构包含合并财务报表、主营业务分板块营收明细、产能产量披露项,字段涵盖营收、产能、产量等,单位分别为人民币元、万吨、元/吨,单份完整上市公司年报文档长度可达数十页。
这些特征在「引用来源与溯源」这一环带来什么约束
化纤品类数据来源分散且权威性存在差异,要求溯源环节需明确标注数据源类型与更新时间,避免混淆不同渠道的信息。单份财报包含多板块细分数据,有效信息片段分布分散,需精准匹配对应财报片段与业务问题,避免跨板块无关内容混入回答。此外,行业数据存在专属字段缩写,需在溯源时保留原始字段名,确保引用的准确性与可读性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
recall_top_k | 前8-12条 | 化纤财报细分片段数量较多,过多召回会引入无关内容,过少则无法覆盖问题所需的全部细分数据 |
vector_segment_length | 600-800字符 | 化纤财报包含长表格与明细项,过长分段会丢失字段关联,过短则破坏业务逻辑的完整性 |
source_tag_mode | 按数据源类型标记 | 化纤数据来源权威性差异明显,需明确区分交易所公告、行业协会数据等不同类型的来源 |
rerank_top_k | 前4-6条 | 细分财报片段相似度较高,重排可过滤低相关内容,保留最匹配的溯源片段 |
enable_source_fragment | 开启 | 需还原知识库或工具调用返回的原文片段,符合财报分析的严谨性要求 |
vector_model | 按实测标定 | 不同向量模型对化纤行业术语的编码效果存在差异,需根据实际召回效果调整 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:Function CALL调用MySQL数据后,回答中未显示数据库原文片段,仅返回结构化结论。原因:未开启
enable_source_fragment配置,或未在工具调用逻辑中绑定原文片段引用参数。 - 现象:召回的片段包含非化纤板块的石化内容,与问题不匹配。原因:
vector_segment_length设置过长,导致跨板块的长文本被合并为一个分段,破坏了细分数据的关联性。 - 现象:溯源标签仅显示文件名,未区分数据源类型,无法判断信息权威性。原因:
source_tag_mode设置为仅显示文件名,未按数据源类型添加标记。
怎么确认配好了
- 发起包含化纤细分板块营收问题的测试对话,查看回答下方的溯源标签,确认每个标签标注了数据源类型与文件名。
- 查看召回片段的长度,确认分段未超过预设的
vector_segment_length取值,且未包含无关板块内容。 - 调整
recall_top_k取值,测试不同召回条数下的回答完整性,确认覆盖了问题所需的所有细分数据片段。 - 调用Function CALL获取MySQL中的化纤原料成本数据,确认回答中附带了数据库查询返回的原文片段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。