这个品类的数据长什么样
化学制药财报的数据来源主要为境内外证券交易所的法定披露平台、药企官方发布的年度、半年度与季度报告,以及行业公开的研发管线数据库。更新节奏遵循法定披露周期,按固定时点发布不同周期的报告。文档结构通常包含管理层讨论与分析、研发投入明细、产品线营收构成、临床试验管线进展、核心财务指标等模块。字段涵盖研发投入金额、各产品线营收金额、存货账面价值、应收账款余额等,单位多为人民币万元或亿元,部分海外披露报告使用美元计价。
这些特征在「模型接入与配置」这一环带来什么约束
化学制药财报的文档长度普遍较长,核心数据分散在多个模块,对模型的上下文窗口容量提出更高要求。多维度的细分字段需要精准匹配,对知识库召回的精度与召回条数有明确约束。固定的披露周期使得知识库的同步更新可按固定节点规划,但需适配不同药企的披露格式差异,需支持自定义解析规则。长文本段落与细分字段的组合,要求文档拆分的粒度需兼顾上下文完整性与检索精准度,避免关键信息丢失或冗余片段过多。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000–12000 令牌 | 化学制药单篇财报文档长度较长,需覆盖研发、营收、管线等多模块的核心文本,避免上下文溢出 |
chunkSize | 1000–1500 字符 | 财报中研发管线描述、营收明细等段落长度较大,该粒度可保留段落完整性同时便于精准检索 |
overlapRate | 10–20% | 拆分后的文本片段需保留上下文关联,避免关键信息被截断在片段边界 |
recallTopK | 前8–10 条 | 财报核心字段较多,需召回足够数量的相关片段以支撑完整分析 |
similarityThreshold | 0.75–0.85 | 需精准匹配财报中的研发、营收等细分字段,避免无关片段干扰分析结果 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 单篇财报包含大量文本与表格解析,该时长可覆盖多数合规财报的解析耗时 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:本地部署的14B参数模型,启用知识库后返回
500 Internal Server Error,无知识库时可正常交互,版本为4.8.14。原因:知识库召回的文本片段总长度超出模型配置的maxContext参数上限,导致上下文溢出。 - 现象:配置本地TTS模型接入后,工作流调用TTS节点返回
Model connection failed错误。原因:未将本地TTS模型的访问端口与API路径正确填入FastGPT的模型接入配置项,或未开启模型的跨域访问权限。 - 现象:在大模型节点的提示词中设置限制回答300字,但生成内容远超该长度。原因:未同时配置模型的
maxOutputTokens参数,或提示词的字数约束未被模型正确解析,导致输出长度不受控。
怎么确认配好了
- 上传单篇完整的化学制药财报PDF,检查解析后的文本片段是否覆盖研发投入、营收构成、管线信息等核心字段,核对解析耗时是否在
PARSE_FILE_TIMEOUT_SECONDS参数设定的范围内。 - 发起针对财报中具体研发项目或产品线的查询,检查召回的文本片段是否包含相关内容,核对召回条数与
recallTopK参数的设置是否一致。 - 测试本地部署的大模型接入知识库后的交互,检查是否能正确提取财报中的数值字段并生成结构化分析,验证是否出现上下文溢出类报错。
- 配置TTS接入后,触发工作流生成音频,检查音频是否正常生成并可正常播放,核对TTS模型的接入参数是否与本地部署配置一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。