这个品类的数据长什么样
热力营销的数据主要来自线下热力点位的客流采集系统、用户线上行为埋点接口、门店运营后台。数据更新节奏为小时级或实时,部分核心点位支持分钟级刷新。单条数据文档包含点位唯一标识、点位名称、采集时段、到客人次、平均停留时长、经纬度坐标、触达用户交互标签等字段。其中到客人次单位为人次,停留时长单位为秒,经纬度采用十进制坐标格式,采集时间采用ISO 8601标准格式。
这些特征在「模型接入与配置」这一环带来什么约束
热力营销数据的小时级/实时更新节奏,要求模型接入环节配置与数据刷新周期对齐的增量索引更新策略,避免召回过期数据。多字段结构化特征包含经纬度、交互标签等,要求配置字段映射规则,将点位标识、行为标签等核心字段作为模型输入的优先级字段。到客人次、停留时长的标准化单位要求预处理环节统一数据格式,避免因单位不匹配导致模型推理异常。点位唯一标识字段需作为知识库的主键配置,防止重复索引同一位点数据。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
embedding_batch_size | 32–64 条 | 单条热力数据包含多字段,批量过大会触发内存限制,批量过小会降低索引构建效率 |
index_update_interval | 1 小时 | 匹配热力数据小时级的更新节奏,平衡索引延迟与服务器资源占用 |
max_context_length | 800–1200 字符 | 单条热力数据的字段总长度适中,过长窗口会引入冗余字段干扰模型推理 |
unique_key_field | point_id | 点位唯一标识为热力数据的核心识别字段,可避免重复索引同一位点的历史数据 |
embedding_model_type | 本地部署M3E系列 | 结构化热力数据需要语义理解准确的轻量化模型,本地部署可规避云端调用的网络延迟 |
parse_field_separator | , | 热力数据多采用逗号分隔的结构化格式,与默认解析规则适配性更强 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用本地部署的M3E模型时返回连接超时错误,排查后发现配置的
embedding_api_address未添加http://协议前缀。原因是4.8.19版本后本地模型的地址配置项新增了协议校验规则,未正确配置会导致连接失败。 - 配置oneapi作为嵌入模型时,无法单独指定索引模型使用的嵌入接口。原因是未开启「独立索引模型配置」开关,系统默认复用聊天模型的配置参数,导致oneapi的嵌入接口设置被覆盖。
- 检索热力营销数据时出现重复点位的召回结果,且日志显示主键字段未正确匹配。原因是未将
unique_key_field配置为point_id,系统默认使用文件路径作为主键,导致同一位点的多时段数据被重复识别。
怎么确认配好了
- 查看知识库的索引日志,确认每条热力数据的字段均被正确解析,无缺失或格式异常的字段。
- 发起单条数据的嵌入测试,核对嵌入结果的向量维度与所选模型的标准维度一致。
- 手动触发一次增量索引,确认索引更新的执行时间与配置的
index_update_interval匹配。 - 检索指定点位的历史数据,确认召回结果中无重复条目,且字段单位符合预设标准。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。