这个品类的数据长什么样
中药企业财报数据主要来源于境内证券交易所披露的定期报告、企业官方发布的年度/半年度/季度经营公告,更新节奏遵循法定披露要求,按季度、半年度、年度固定更新,同时伴随临时经营公告不定期发布。文档结构包含主营业务拆解(中药材种植、中成药生产、医药商业流通等板块)、研发投入、存货明细(含中药材原料库存)、毛利率、合规认证相关披露等字段,单位涵盖货币类、数量类等多种类型。
这些特征在「向量模型与索引」这一环带来什么约束
中药财报数据兼具结构化财务字段与非结构化业务披露内容,且包含多类单位的业务指标,对向量模型的多模态语义编码能力提出要求。固定周期更新与临时公告并行的发布节奏,要求索引系统支持增量更新与批量更新结合的同步策略。不同业务板块的字段语义差异显著,需针对细分字段配置差异化的向量召回权重,避免跨板块语义混淆。同时,医药领域专属术语较多,需选用适配医药生物领域的预训练向量模型,保障语义编码准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
EMBEDDING_MODEL | bge-large-zh-v1.5 | 适配医药生物领域专业术语,语义编码准确性更高 |
INDEX_TYPE | Zilliz | 支持增量索引与批量更新,适配中药财报固定周期+临时公告的更新节奏 |
RECALL_TOP_K | 20-30 条 | 覆盖中药财报中多板块的相关内容,避免遗漏细分业务信息 |
SIMILARITY_THRESHOLD | 0.75-0.85 | 过滤低匹配度的非相关财报片段,保障召回结果相关性 |
CHUNK_SIZE | 800-1200 字符 | 平衡专业术语完整性与语义连贯性,适配中药财报长段落结构 |
INDEX_SYNC_STRATEGY | scheduled + incremental | 兼顾固定周期披露与临时公告的同步需求,降低索引更新开销 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为迁移向量存储至Zilliz后出现索引同步失败,日志返回
400 Bad Request错误。原因是未配置Zilliz的向量维度与本地向量模型输出维度一致,导致维度不匹配。 - 现象为私有化重排模型接入后返回结果条数与配置不符,召回结果被意外截断。原因是未正确配置
RE_RANK_TOP_K参数,或私有化模型的接口返回格式未适配FastGPT的解析规则。 - 现象为搜索结果仅覆盖财报核心财务字段,未包含中药材库存等业务细节。原因是未针对细分业务字段调整向量召回权重,导致核心字段优先级过高,覆盖范围受限。
怎么确认配好了
- 上传单份中药年度财报样本,查看向量索引的分段记录,确认分段长度符合配置的
CHUNK_SIZE要求。 - 输入中药材种植相关的测试关键词,执行检索操作,核对召回结果的总条数与配置的
RECALL_TOP_K一致。 - 切换向量存储后端至Zilliz,查看索引同步日志,确认无维度不匹配或连接超时报错。
- 启用私有化重排模型,输入多组财报相关关键词,验证返回结果的排序优先级符合业务需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。