这个品类的数据长什么样
中药企业财报数据主要来自境内证券交易所公开披露的定期报告,包括年度、半年度及季度报告,更新节奏严格遵循监管要求,年报于每年4月30日前完成披露,半年度报告于8月31日前完成。文档结构包含合并财务报表、业务经营分析板块,其中中药相关字段涵盖中药材采购量(单位:吨)、中成药产能(单位:万盒/片)、中药研发投入金额(单位:万元)、自有种植基地面积(单位:亩)等,部分报告还会披露独家中药品种的批文数量及销售占比。
这些特征在「多轮对话与提示词」这一环带来什么约束
中药财报的固定更新节奏要求多轮对话需默认检索最近披露的一期或多期定期报告,避免使用过期数据。业务板块拆分明确且包含多类单位字段,要求多轮对话中需引导用户明确具体的中药业务模块,同时在提示词中限定检索范围仅包含中药相关内容,防止混入其他业务数据。不同字段的单位差异,要求系统在生成回答时自动标注对应单位,或在多轮对话中主动确认用户所需的统计单位,避免出现单位混淆。同时,公开披露的财报格式相对规范,可基于固定字段模板配置提示词,减少非结构化数据的解析误差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 12000–15000 字符 | 中药财报单份年报文本长度通常较大,需保留足够的上下文用于多轮对话的逻辑连贯 |
RECALL_TOP_K | 前8–12条 | 中药财报包含多类细分业务数据,需召回足够多的片段覆盖不同业务板块的信息 |
SIMILARITY_THRESHOLD | 0.72–0.80 | 区分财报中通用财务术语与中药专属业务术语,避免召回无关的行业通用数据 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 单份大型财报解析需较长时间,防止解析过程超时中断 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 覆盖完整的年度财报PDF及附件文档,避免因文件过大无法上传 |
RERANK_TOP_N | 前4–6条 | 对召回的片段进行重排,聚焦与中药业务直接相关的内容,提升回答精准度 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:本地部署后上传中药财报文件,数据处理阶段返回空内容。原因:未配置
PARSE_FILE_TIMEOUT_SECONDS为足够长的时长,大型财报解析超时后未生成有效分片数据。 - 现象:工作流中知识库搜索调试正常,但AI对话阶段未参考知识库内容。原因:未在提示词中限定检索范围为中药业务板块,导致模型优先调用通用知识库,未优先调用目标财报数据。
- 现象:MongoDB中无法查询到对话历史记录。原因:未开启对话历史存储开关,或配置的数据库连接字符串权限不足,无法写入对话日志。
怎么确认配好了
- 上传单份测试用中药财报文件,确认数据处理流程完成且无异常报错。
- 发起包含中药业务细分问题的多轮对话,核对模型回答是否匹配财报中的具体字段及单位。
- 登录配置的MongoDB数据库,查询对应对话历史集合,确认记录已正常写入。
- 发起http请求调用知识库对话接口,验证返回结果是否包含目标财报的相关片段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。