这个品类的数据长什么样
数据主要来自门店POS系统导出的营业日报、供应链采购入库单、线下菜单电子档、行业协会公开调研文档。更新节奏差异较大,菜单SKU信息每周更新,客流与营收数据每日同步,供应链台账按月更新。文档多为结构化表格或半结构化报表,包含门店编码、营业日期、客单价、食材进价、到店人次等字段,单位涵盖元、人次、千克、百分比等。
这些特征在「知识库检索与召回」这一环带来什么约束
结构化占比高的数据要求检索时需支持字段级精准匹配,避免通用语义召回导致的无关结果。多更新节奏的数据源需要划分同步批次,按日、周、月分别执行增量索引,避免全量索引占用过多算力。文档字段包含多单位数值,召回时需统一单位转换逻辑,确保不同门店的客单价、进价数据可横向对比。单文档内容多为短表格或单行记录,需调整分段规则,避免拆分后丢失字段关联信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 适配酒店餐饮文档的短表格与单行记录,保留字段关联完整性 |
recall_top_k | 前 10–15 条 | 覆盖多门店、多品类的检索需求,避免单门店数据过少 |
similarity_threshold | 0.72–0.78 | 过滤低匹配度的非结构化文本,保留字段匹配度较高的结构化记录 |
rerank_top_n | 前 3–5 条 | 聚焦核心门店或核心SKU的精准结果,符合投研场景的决策需求 |
incremental_index_schedule | 每日2:00更新营收数据、每周1:00更新菜单数据、每月10:00更新供应链台账 | 匹配不同数据源的更新节奏,减少算力浪费 |
parse_structured_table | 开启 | 保留表格字段与内容的对应关系,避免拆分后丢失结构化信息 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:重排模型部署后通过测试,但每次检索返回的
is_re_ranked字段为false。原因:未在检索请求中携带rerank_model_id参数,或配置的重排模型未绑定至当前知识库。 - 现象:在线聊天与API调用的检索结果差异显著,API返回结果正确率偏低。原因:API调用未正确传递
prompt_template参数,或未设置use_chat_mode参数,导致未启用投研场景的专属提示逻辑。 - 现象:工具调用环节无法选择指定知识库。原因:未在工具配置中绑定目标知识库的索引ID,或未开启工具的知识库权限开关。
怎么确认配好了
- 发起单次API检索请求,查看返回结果中的
total_hits字段,确认召回条数符合recall_top_k的配置范围。 - 调用重排模型测试接口,传入检索结果与用户问题,确认返回结果的
score字段排序符合预期。 - 检查增量索引任务的日志,确认不同数据源的同步时间与
incremental_index_schedule配置一致。 - 对比在线聊天与API调用的检索参数,确保两者的
similarity_threshold、rerank_top_n等配置完全一致。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。