这个品类的数据长什么样
证券尽调的数据来源包括沪深交易所公开披露的上市公司定期报告、临时公告,证监会及地方证监局发布的监管文件,以及行业协会公开统计数据。更新节奏为定期报告按季度、年度固定更新,临时公告随重大事件实时推送,监管文件随监管动作发布。文档结构多为结构化报表与非结构化文本结合,结构化部分包含营业收入、归母净利润等财务指标,非结构化部分包含业务进展、风险提示。字段单位多为元、万元、万股等金融计量单元,部分字段为枚举类型,比如监管问询类型、审计意见类型。
这些特征在「模型接入与配置」这一环带来什么约束
证券尽调数据的多源混合、更新节奏差异大、文档长度跨度大、字段有固定计量规则的特征,对模型接入与配置带来多重约束。多源数据需配置差异化的解析规则,区分结构化财务报表与非结构化公告文本的处理逻辑。实时更新的临时公告需配置短周期增量同步触发参数,避免全量拉取的资源浪费。超长文本的定期报告需调整上下文窗口与分段参数,防止内容截断。固定单位的字段需配置提取校验规则,确保输出指标与披露单位一致,同时需加入数据源合规校验逻辑,避免非授权数据接入。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8192–16384 tokens | 证券定期报告单篇文本长度可达数十万字符,需适配长上下文处理需求,避免核心内容截断 |
PARSE_STRUCTURED_TABLE | 开启 | 证券尽调数据包含大量结构化财务报表,开启后可精准提取字段与对应单位,避免非结构化解析的误差 |
RECALL_INCREMENTAL_INTERVAL | 5–15 分钟 | 临时公告随重大事件实时更新,短间隔可保证最新公告及时被召回,满足尽调时效性要求 |
FIELD_VALIDATION_RULES | 匹配披露单位与枚举值范围 | 证券披露数据有固定计量规则与枚举类型,校验可避免提取错误的指标与单位 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 单份年度报告PDF文件通常不超过200MB,适配主流披露文件的大小限制 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 超长报告的解析耗时较长,设置合理超时避免任务中断 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用模型时出现
Unexpected end of JSON input报错。原因:未正确配置模型接口的请求头或请求体格式,导致返回的响应内容不完整,无法被正常解析。 - 现象:使用开源大模型处理长文本尽调报告时,出现输出答非所问的情况。原因:未调整适配长文本的上下文窗口参数,导致模型无法获取完整的输入上下文,无法关联前后文信息生成准确回答。
- 现象:上传QA格式的知识库文件后,大模型命中问题但输出不符合预期的额外内容。原因:未配置知识库的输出格式约束参数,导致模型额外生成未定义的内容,偏离预设的输出规则。
怎么确认配好了
- 上传一份标准的上市公司年度报告,检查解析后的结构化字段是否完整且单位正确,核对配置的字段校验规则是否生效。
- 发起一次临时公告的增量同步任务,确认任务触发间隔符合预设参数,且最新公告被正常召回。
- 调用模型接口测试长文本输入,检查上下文窗口是否适配输入长度,无内容截断情况。
- 模拟QA格式的知识库查询,确认模型输出仅包含预设的内容,无额外冗余信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。