这个品类的数据长什么样
医美投研数据来源包括医美机构的临床操作记录、耗材供应商的产品规格文档、行业监管部门发布的合规公告、区域医美项目收费公示、求美者的术后反馈档案等。更新节奏因数据源类型不同,合规公告随政策调整不定期更新,耗材参数随新品上线按月更新,临床记录按每日归档。文档结构包含长文本白皮书、结构化表格(含项目名称、资质编号、规格参数等字段)、单条临床案例短文本。字段包含项目名称、合规资质编号、耗材规格、适用部位等,单位涉及元、毫升、平方厘米等。
这些特征在「部署与升级」这一环带来什么约束
医美投研数据包含大量结构化表格与长文本文档,部署时需适配表格解析与长文本拆分的专属配置;不同数据源的更新频率差异较大,需配置灵活的增量同步规则;升级过程需兼容旧版投研工作流,避免因功能变更中断业务;离线部署场景下,需提前配置本地镜像的存储路径与依赖项,规避镜像启动失败的问题。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TABLE_MODE | 开启表格结构化解析 | 医美数据包含大量耗材、收费的结构化表格,需提取结构化字段用于投研检索 |
SYNC_INCREMENTAL_CRON | 0 0 2 * * * | 医美合规公告多在夜间更新,每日凌晨2点执行增量同步可覆盖最新数据源 |
LEGACY_TEXT_PROCESSOR_ENABLE | 开启 | 升级后需兼容旧版投研工作流,保留原文本加工逻辑 |
LOCAL_PG_IMAGE_PATH | /opt/fastgpt/local_images | 离线部署场景下,指定本地镜像存储目录,避免拉取远程镜像失败 |
PARSE_CHUNK_LENGTH | 800–1200 字符 | 适配医美长文档的段落拆分需求,平衡检索精度与上下文完整性 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 支持上传区域医美行业白皮书等大型文档,满足全量数据导入需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:使用v4.9.10版本的接口创建文本集合时,传入
split_mode为paragraph后,返回的拆分结果未按段落划分。原因:未开启PARSE_PARAGRAPH_PRIORITY配置项,导致段落优先拆分模式未生效。 - 现象:从v4.9.0升级到v4.9.10后,原有的文本加工功能无法正常调用。原因:未在升级完成后启用
LEGACY_TEXT_PROCESSOR_ENABLE配置项,系统默认启用新版处理器,旧版逻辑未加载。 - 现象:离线部署时拷贝镜像后,
aiproxy_pg镜像启动失败,控制台报错显示image pull failed。原因:未配置LOCAL_IMAGE_REGISTRY_PATH指向本地镜像存储目录,系统尝试拉取远程镜像导致失败。
怎么确认配好了
- 调用创建文本集合的接口,传入
split_mode参数为paragraph,检查返回的文本拆分结果是否按自然段落分割,确认段落优先拆分配置生效。 - 查看系统升级日志,确认
LEGACY_TEXT_PROCESSOR_ENABLE配置项已启用,进入知识库管理界面,检查文本加工功能是否正常加载。 - 执行
docker ps命令,确认aiproxy_pg镜像处于运行状态,检查本地镜像路径配置是否与LOCAL_PG_IMAGE_PATH一致。 - 手动上传一份包含耗材参数的医美表格文档,查看解析后的结构化字段是否完整提取,确认表格解析配置生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。