这个品类的数据长什么样
光模块相关企业的财报数据主要来自公开披露的定期报告与临时公告,更新节奏为季度报告每季度更新一次,年度报告每年更新一次,临时公告随重大经营节点发布。文档多为PDF格式,包含固定结构的章节,涵盖营收构成、光模块出货量、单位售价、成本毛利率、产能利用率等字段,字段单位多为台、元/件、万元等,部分数据会按高速、中低速光模块等细分品类拆分披露。
这些特征在「工作流编排」这一环带来什么约束
光模块财报的公开披露格式差异、固定章节结构与按细分品类拆分的字段特征,对工作流编排带来多重约束。首先,PDF格式的财报需配置针对性的文档解析规则,提取指定章节的光模块相关数据,避免无关内容干扰后续处理。其次,按季度、年度固定更新的特性要求工作流支持定时触发与手动触发结合的执行模式,适配不同数据更新节奏的处理需求。最后,细分品类拆分的字段需要配置精准的字段抽取规则,确保提取的出货量、售价等数据与光模块业务直接关联,避免混入其他业务板块的财务信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 光模块财报PDF页数较多、内容结构复杂,需预留足够时长完成完整解析 |
chunkSize | 800–1200 字符 | 适配财报章节长文本的拆分需求,保证单段包含完整的业务数据段落,避免拆分中断字段 |
recallTopK | 前 3–5 条 | 核心财务数据集中在少数章节,该取值可平衡召回完整性与无关内容过滤 |
similarityThreshold | 0.75–0.85 | 精准匹配光模块相关的财报章节与字段,避免混入其他业务板块的非目标数据 |
scheduleTrigger | 每季度、每年 | 匹配财报按季度、年度固定更新的节奏,减少无效执行次数 |
exportFormat | JSON | 适配后续数据流转与二次处理的需求,符合工作流导出的通用格式要求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:导入他人分享的JSON工作流后,界面中未显示文本加工模块,或模块显示为灰色不可用状态。原因:本地运行环境未部署对应文本处理插件,或工作流引用的插件版本与本地安装版本不匹配。
- 现象:点击工作流的导出按钮后,无法生成JSON格式的下载文件,界面弹出权限不足提示。原因:未开启工作流的导出权限配置,或当前账号无对应导出操作的权限。
- 现象:将
recallTopK设置为2000后,生成的分析报告token数远超预期,超出模型上下文限制。原因:光模块财报的召回数据包含大量非核心冗余内容,过高的召回条数会引入无关文本,导致token消耗超标。
怎么确认配好了
- 上传一份本地保存的光模块企业财报PDF,查看解析后的文本分段是否完整覆盖核心业务章节,无明显内容截断或遗漏。
- 触发一次工作流执行,查看输出的JSON数据中是否包含光模块出货量、单位售价等预设目标字段,字段格式与预期一致。
- 调整
recallTopK与similarityThreshold参数后,对比不同配置下的输出内容,确认核心数据召回完整且无过多无关信息。 - 测试定时触发功能,确认工作流会按预设的周期自动执行,无需手动触发会话交互。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。