这个品类的数据长什么样
住宅开发投研的数据来源包括土地交易公开信息、住建部门备案文件、项目施工日志、商品房预售许可公示、行业专项调研报告。数据更新节奏按项目节点或官方公示周期执行,单份文档长度差异较大,从几页的出让公告到数十页的全周期可研报告均有覆盖。文档字段包含项目区位、容积率、计容面积、拿地成本、施工节点、备案均价等,单位涉及平方米、万元、容积率(无量纲)、工期(月)等,部分文档存在嵌套表格与多版本附件。
这些特征在「对话日志与审计」这一环带来什么约束
文档长度差异大,会导致对话日志的存储占用波动较大,需限制单文档解析后的日志分片大小。多版本附件与嵌套表格会增加上下文关联的日志条目数量,审计时需支持按项目ID溯源多版本数据。字段多且单位杂,需在日志中记录原始数据的单位与字段名,避免审计时出现单位混淆。更新频率不固定,需在每条日志中标记数据的更新时间戳,确保可追溯数据版本。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
LOG_RETENTION_DAYS | 90 天 | 覆盖住宅开发项目从拿地到开盘的常规审计周期,满足审计留存要求 |
MAX_CONTEXT_TOKENS | 16384 tokens | 适配数十页可研报告的上下文召回需求,避免长文本解析后日志被截断 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 预留足够时间完成多页文档的文本拆分与日志生成,防止解析超时导致日志缺失 |
RECALL_TOP_N | 前 8 条 | 平衡召回精度与日志冗余,覆盖住宅开发投研核心指标的查询场景 |
AUDIT_LOG_AUTO_SYNC | 开启 | 自动同步所有对话交互至审计模块,避免手动导出遗漏关键记录 |
SIMILARITY_THRESHOLD | 0.75–0.85 | 过滤低相关性的召回结果,减少无效日志条目,提升审计效率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:Docker部署后访问地址转圈后失败,系统日志无明确报错。原因:未配置
LOG_FILE_MAX_SIZE限制日志文件大小,日志溢出导致服务端口阻塞。 - 现象:配置第三方机器人后,第三方侧显示消息发送成功,但FastGPT对话日志中无对应交互记录。原因:未开启
AUDIT_LOG_AUTO_SYNC配置,交互日志未同步至审计模块。 - 现象:调用关联模型时返回500错误,系统日志未捕获具体报错信息。原因:未将
LOG_LEVEL设置为DEBUG,仅记录INFO级别的日志,无法捕获底层模型调用的异常详情。
怎么确认配好了
- 查看系统配置页面的
LOG_LEVEL与LOG_RETENTION_DAYS项,确认其取值匹配当前业务的审计需求。 - 发起一次包含长文档解析的对话,检查对话日志中是否包含完整的文本拆分与召回条目,无截断或缺失。
- 触发一次模型调用,对比FastGPT配置的模型参数与日志中记录的实际调用参数,确认一致性。
- 检查审计模块的日志列表,确认近段时间的交互记录已自动同步,无遗漏条目。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。