这个品类的数据长什么样
航天装备研报的数据来源包括中国航天科技集团、中国航天科工集团公开技术白皮书,国防军工行业协会发布的行业研报,以及证券研究机构的航天装备专项研报。更新节奏随重大型号节点波动,如发射任务前后、年度行业总结发布时更新。文档结构多包含型号参数表、分系统设计细节、试验数据、产业链分析,字段涵盖起飞质量、近地轨道运载能力等,单位分别为吨、千牛等,单篇文档长度差异较大。
这些特征在「工作流编排」这一环带来什么约束
不同来源的研报格式差异显著,包含加密PDF、带复杂表格的Word文档等,要求工作流适配多格式解析;参数字段多且单位细分,需在提取环节做标准化处理,避免单位混淆;单篇文档长度较长,解析与分段需适配长文本处理逻辑,防止上下文截断;更新频率随型号节点波动,工作流需支持定时批量更新知识库的配置。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 航天装备研报单篇页数多、参数表格复杂,解析耗时显著高于通用文档 |
分段长度 | 1000–1500 字符 | 单篇研报参数段包含多组关联数据,分段需保留参数上下文完整性 |
召回条数 | 前 6–10 条 | 航天装备研报参数细分维度多,需覆盖多类相关参数的召回结果 |
相似度阈值 | 0.78–0.85 | 参数字段精准度要求高,需过滤低相关性的非专业研报内容 |
全局变量动态赋值 | 按文档标签匹配对应知识库ID | 不同航天装备型号对应专属知识库,需动态绑定检索范围 |
代码运行节点超时时间 | 300 秒 | 参数提取代码需遍历多字段、校验单位一致性,处理耗时较长 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:工作流运行后弹出
chat:ai_input_is_empty报错,AI模型无有效输入内容。原因:未将代码运行节点的result输出字段正确绑定到AI模型的用户问题参数中,未完成变量映射配置。 - 现象:全局变量“选择知识库”无法随检索需求动态切换,始终使用固定知识库。原因:未配置
全局变量动态赋值规则,未建立文档标签与对应知识库ID的映射关系。 - 现象:文本提取节点返回的参数单位不一致,出现“千牛”与“牛”混用的情况。原因:未在文本提取节点配置单位标准化处理逻辑,未对提取后的参数字段做统一转换。
怎么确认配好了
- 触发单次工作流测试,查看代码运行节点的输出日志,确认
result字段包含正确的参数提取结果。 - 上传带有不同型号标签的测试文档,验证全局变量“选择知识库”是否自动匹配到对应知识库。
- 提交包含多组航天装备参数的查询,确认召回结果的条数符合预设的
召回条数配置。 - 解析单篇长文档,确认解析节点未出现超时报错,分段内容完整保留参数关联信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。