这个品类的数据长什么样
综合服务投研的数据来源包含券商官方研报平台、公开行业数据库、上市公司公告系统及行业协会公开文档。更新节奏随数据源类型区分,上市公司公告实时同步,券商研报按每日发布节奏同步,行业周报按周更新。文档包含结构化与非混合内容,结构化部分包含发布机构、发布时间、关联行业代码等字段,非结构化部分包含研报正文、核心观点等内容,数值类字段记录行业相关量化指标,单篇文档正文最长可达数万字符。
这些特征在「部署与升级」这一环带来什么约束
投研数据的多源分散特性要求部署阶段需配置多数据源对接规则,同时支持增量同步与全量同步两种模式。混合结构化与非结构化的文档要求部署时启用混合向量索引配置,兼顾结构化字段与非结构化正文的检索能力。内网部署场景下,需关闭公网数据源拉取开关,配置本地或内网可用的镜像源,避免依赖公网资源。升级阶段需兼容存量结构化数据导入模板,避免升级后存量文档无法正常解析或检索。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
SYNC_DATASOURCE_INTERVAL | 300–1800 秒 | 覆盖投研数据从实时到每日的更新节奏,平衡同步时效性与服务器负载 |
PARSE_MIXED_DOC_ENABLE | 开启 | 投研文档同时包含结构化字段与非结构化正文,需启用混合解析能力 |
UPLOAD_FILE_MAX_SIZE | 1000 MB | 适配单份研报合集或行业数据库导出文件的常规大小上限 |
VECTOR_SEARCH_TOP_K | 10–20 条 | 保证投研检索结果覆盖多维度观点,满足综合服务的信息全面性需求 |
REDIS_IMAGE | 阿里云容器镜像服务redis:7.0-alpine | 内网环境无法访问公网时,可通过该镜像源快速拉取依赖,解决拉取失败问题 |
MODEL_API_INTRANET_ENABLE | 开启 | 适配内网部署的第三方模型API调用需求,禁止公网访问链路 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:执行docker-compose up -d时拉取redis镜像失败,返回连接超时错误。原因:未配置阿里云容器镜像源作为拉取地址,内网环境无法访问公网镜像仓库。
- 现象:升级PgVector插件后向量检索功能报错,提示版本不兼容。原因:未提前备份存量向量数据,直接升级插件导致索引结构与新版本不匹配。
- 现象:创建的语言模型无法在应用设置的可选列表中出现。原因:未开启内网模型API开关,或未正确配置模型接口的内网地址与验证密钥。
怎么确认配好了
- 运行docker pull 配置的Redis镜像地址,确认拉取过程无网络报错。
- 手动触发一次指定数据源的同步任务,检查系统后台日志中无数据源连接失败或解析异常的记录。
- 进入知识库管理页面,上传一份测试用的投研文档,确认解析流程正常完成且生成对应的向量数据。
- 进入应用的模型配置界面,确认已添加的内网模型渠道出现在可用模型列表中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。