这个品类的数据长什么样
来源为境内外证券交易所披露的上市公司定期报告、企业内部生产台账与月度经营报表。更新节奏为年度报告每年更新一次,季度报告每季度更新,月度经营数据按月更新。文档结构以结构化表格与段落说明结合,包含装置类别、加工总量、各类产品产出量、原材料采购成本、总营收等模块。字段包括装置编号、加工量、产出量、采购单价、营收金额,单位分别为台、吨、万元等。
这些特征在「知识库检索与召回」这一环带来什么约束
数据源分散于公开披露报告与内部经营台账,要求检索链路支持跨源关联召回,避免数据割裂。不同更新节奏的数据源需要对应差异化的增量更新触发规则,月度数据需高频同步,年度数据仅需定期全量更新。文档包含结构化表格与段落说明,要求检索模型同时支持结构化字段匹配与非结构化文本语义召回。字段与单位的明确性要求高,检索时需自动匹配字段关联规则,避免不同单位的数值混淆导致召回偏差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
EMBEDDING_MODEL | text-embedding-3-large | 炼化财报包含大量专业术语与结构化数值,该模型对长文本与专业语义的匹配精度更高 |
RECALL_TOP_K | 前10条 | 炼化财报数据字段多,需覆盖足够的关联信息避免漏召回 |
CHUNK_SIZE | 800–1200 字符 | 炼化财报的结构化表格与段落长度适中,该分段区间可保留完整的语义单元与字段关联 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 单份炼化财报文档通常包含多页表格与长段落,需足够时间完成结构化解析与分段 |
SIMILARITY_THRESHOLD | 0.75–0.85 | 需平衡召回的准确率与召回率,避免过多无关内容或遗漏有效信息 |
VECTOR_DB_TYPE | 按场景适配 | 结构化数值字段较多时,可搭配关系型数据库存储结构化元数据,非结构化文本存储向量,提升检索效率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为更换
EMBEDDING_MODEL后,原有知识库召回结果出现偏差,部分历史文档无法匹配新的语义特征。原因是未执行向量索引重建,原有向量仍基于旧模型生成,未同步更新。 - 现象为使用
PostgreSQL存储向量时,召回结果的语义匹配度低于预期。原因是未启用向量扩展插件或未配置合适的向量索引类型,无法高效处理专业术语的语义检索。 - 现象为导入炼化财报文档时出现
PARSE_FAILED错误码,文档解析进度停滞。原因是文档包含复杂嵌套的结构化表格,默认解析规则无法完整提取字段与数值关联关系。
怎么确认配好了
- 核对
EMBEDDING_MODEL配置项,确认与当前选用的模型一致,且已触发历史文档的向量索引重建。 - 输入包含炼化专业术语的查询词,检查召回结果中是否包含目标字段与对应的数值信息。
- 导入一份测试用的月度经营数据文档,检查解析进度与字段提取结果是否正常。
- 对比不同向量数据库的召回测试结果,确认符合业务对匹配精度的要求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。