这个品类的数据长什么样
专业服务投研知识库的数据来源涵盖行业研报、上市公司公告、监管政策文件、实地调研纪要等。数据更新节奏存在差异,监管公告随发布实时更新,行业研报按工作日定期更新,调研纪要随调研完成即时入库。单份文档包含结构化与非结构化内容,结构化字段包含报告编号、发布机构、发布时间、行业分类代码,非结构化内容为正文段落。文档以“篇”为单位存储,时间字段采用ISO 8601标准格式,每个文档绑定唯一标识用于关联调用记录。
这些特征在「对话日志与审计」这一环带来什么约束
数据来源分散且更新节奏不一,要求对话日志需精准关联对应文档的唯一标识与版本信息,避免审计时混淆不同周期的投研内容。结构化与非结构化混合的文档结构,要求日志需同时记录查询触发的结构化筛选条件与调用的非结构化正文片段,覆盖审计全维度。文档绑定唯一标识的设计,要求审计环节可通过标识快速定位单份文档的全量调用记录。时间字段的标准化格式,要求日志存储与查询需适配ISO格式,便于按时间范围快速筛选审计数据。投研内容涉及专业信息,要求日志需留存完整对话链路,同时支持敏感信息脱敏处理,满足合规要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
log_retention_days | 180–365 天 | 匹配专业服务投研的合规审计周期要求,覆盖监管要求的留存时长 |
audit_log_fields | ["user_id", "session_id", "document_ids", "query_time", "response_content"] | 覆盖投研对话的核心审计维度,匹配知识库文档的结构化字段特征 |
max_context_tokens | 8000–16000 令牌 | 适配投研文档较长的特点,保留足够上下文以完整记录对话关联的文档片段 |
mongodb_shard_key | ["query_time"] | 按时间分片便于按周期查询审计日志,匹配投研数据按时间更新的更新节奏 |
log_sensitive_mask | 开启 | 避免投研对话中涉及的未公开信息泄露,满足专业服务的合规要求 |
parse_log_enable | 开启 | 记录文档解析过程的日志,用于排查投研文档调用异常与关联关系错误 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:MongoDB 集合中无对话日志数据。原因:未开启
log_upload_enable配置,或配置的mongodb_collection_prefix与实际存储集合前缀不匹配。 - 现象:对话日志中未关联投研文档的唯一标识。原因:未在
audit_log_fields中配置document_ids字段,或知识库文档解析未正确写入唯一标识。 - 现象:日志查询返回结果条数与实际不符。原因:未按
query_time设置MongoDB分片键,导致查询时全表扫描,遗漏部分时间范围的日志数据。
怎么确认配好了
- 登录MongoDB控制台,查询配置的
mongodb_collection_prefix对应集合,验证是否存在近7天的对话日志数据。 - 发起一条投研相关的查询,进入会话详情页面,验证日志中包含
user_id、document_ids等配置的审计字段。 - 上传一份测试投研报告,发起关联该文档的查询,验证日志中记录了文档解析的相关信息。
- 触发一条包含敏感信息的测试查询,验证日志中敏感内容已被脱敏处理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。