这个品类的数据长什么样
个护用品财报数据主要来自境内外证券交易所公开披露的定期报告,包括年度报告、中期报告及季度报告,更新节奏固定,符合证券交易所规定的披露节点。文档结构包含管理层讨论与分析、合并财务报表、财务报表附注等模块,字段涵盖营收、归母净利润、毛利率、销售费用、研发费用等,单位多为人民币元或比例,细分品类营收占比等。数据更新频率固定,单份报告长度跨度较大,且包含大量结构化表格与长文本段落。
这些特征在「模型接入与配置」这一环带来什么约束
个护用品财报的固定更新节奏要求配置定时同步任务的触发规则,需匹配证券交易所规定的披露节点,避免获取未披露的财报数据。文档包含长文本与结构化表格,要求开启表格解析功能,需配置表格提取参数,确保营收、毛利率等结构化字段的准确提取。字段多且包含细分品类营收占比等特定字段,需配置实体识别规则,匹配财报中的个护细分品类的字段命名习惯。单份报告长度跨度大,要求配置合理的上下文窗口与分段长度参数,避免截断关键信息。同时,公开披露的数据需符合模型支持的格式,需配置数据预处理规则,确保PDF格式财报文件的正确解析。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000-12000 字符 | 单份个护财报PDF解析后文本长度多在5000-8000字符,预留足够上下文覆盖完整财报段落 |
PARSE_TABLE_ENABLE | 开启 | 个护财报包含大量结构化财务表格,开启后可准确提取营收、毛利率等结构化字段 |
RECALL_TOP_K | 前3-5条 | 个护财报字段多且细分,召回过多会引入无关内容,召回过少会遗漏关键字段 |
SIMILARITY_THRESHOLD | 0.75-0.85 | 个护财报字段精准度要求高,避免召回与财报字段不相关的内容 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 单份个护用品上市公司年报PDF通常在100-300 MB,预留足够上传余量 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大体积财报文件解析需要较长处理时间,避免因超时中断解析流程 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用模型时返回
invalid reference ID报错,返回结果中出现伪造的引用ID。原因:未配置模型的引用ID校验规则,导致模型返回的引用格式不符合FastGPT预设要求。 - 现象:docker本地部署的FastGPT无法连接火山云私有化部署的大模型,返回
connection refused错误。原因:未将MODEL_API_BASE配置为火山云的内网或公网API地址,或网络策略限制了端口访问。 - 现象:classify模块在编辑界面无法选择模型,但发布工作流后可正常调用。原因:前端缓存未同步配置项,或classify模块的模型绑定未正确保存。
怎么确认配好了
- 上传单份已公开的个护用品上市公司年度报告PDF,查看解析后的文本中是否包含营收、归母净利润等字段,确认表格解析功能生效。
- 配置向量召回任务,输入“2023年个护细分品类营收关键词,检查召回结果的条数符合
RECALL_TOP_K的设置。 - 调用配置的大模型,输入测试prompt,检查返回结果中无
invalid reference ID或connection refused错误,确认模型接入配置正确。 - 运行classify模块测试用例,输入财报分类任务,检查分类结果符合预期,确认classify模块配置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。