这个品类的数据长什么样
化学制药行业的财报数据主要来自上市公司年度报告、半年度报告、季度报告,以及交易所公开披露的临时公告。数据更新节奏固定,季度报告于季后1个月内披露,半年度报告于季后2个月内披露,年度报告于季后4个月内披露。文档结构包含标准财务科目与医药专属字段,如研发资本化支出、临床试验费用、管线产品营收占比,字段单位涵盖货币、重量、病例数等多类形式,部分文档嵌套临床试验数据表格与研发管线长文本段落。
这些特征在「文档解析与分块」这一环带来什么约束
医药专属字段与嵌套表格的存在,要求分块时需保留上下文关联,避免拆分跨页的临床试验数据表格与研发管线段落。多类单位混用的情况,要求解析工具需准确识别字段与单位的对应关系,防止分块后单位与字段脱离。大型单文件的占比提升,要求解析环节需适配大文件加载与解析耗时,防止中途中断。财报披露的时效性要求,要求文档解析环节需适配批量文件的快速处理,避免延迟影响后续分析流程。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 化学制药财报包含大量长段落的研发投入描述与临床试验细节,该区间可保留单段核心信息不被拆分 |
chunk_overlap | 150–200 字符 | 财报中跨分块的关联字段(如研发管线对应营收数据)较多,重叠区间可保留上下文关联 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 单份年度财报可能包含多份附件(如临床试验报告、研发管线文档),大文件上传需求明确 |
PARSE_FILE_TIMEOUT_SECONDS | 1200 秒 | 大型PDF财报解析需处理嵌套表格和长文本,超时阈值需适配解析耗时 |
enable_enhanced_parse | 开启 | 4.9.0及以上版本支持该配置,可保留医药财报内嵌表格与公式的结构可读性 |
custom_parse_url | 填写自研医药财报解析接口地址 | 通用解析工具无法精准识别医药专属字段(如临床试验病例数、研发资本化率),自定义接口可适配细分场景 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传单份超过1500 MB的财报PDF时,解析至90%进度报错“偏移量超出范围”。原因:未调整
UPLOAD_FILE_MAX_SIZE参数至适配大文件的取值,默认阈值限制了大型文档的完整加载。 - 现象:通过API上传与平台直接上传的同一份财报,分块结果不一致。原因:未统一配置
chunk_size和chunk_overlap参数,API调用与平台上传使用了不同的分块规则。 - 现象:配置
custom_parse_url后无解析数据返回。原因:自定义接口未适配化学制药财报的专属字段识别,或接口返回格式不符合FastGPT要求的JSON结构。
怎么确认配好了
- 上传单份最大预期尺寸的财报文件,检查上传进度是否完整完成,无报错提示。
- 对比API调用与平台上传的同一份文档,确认分块参数配置一致。
- 调用自定义解析接口(若配置),检查返回的解析结果是否包含医药专属字段。
- 查看解析日志,确认未触发
PARSE_FILE_TIMEOUT_SECONDS相关的超时报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。