这个品类的数据长什么样
基建工程投研数据主要来自项目概算书、施工日志、监理周报、招投标文件、行业技术标准文档。更新节奏随项目节点动态调整,如施工进度更新、设计变更时同步新增文档。文档结构以长文本为主,包含大量结构化表格(如工程量清单、材料消耗表)和专业工程术语,字段包含项目编号、标段代码、工期节点、造价金额等,单位涉及万元、立方米、吨等工程通用计量标准。
这些特征在「对话日志与审计」这一环带来什么约束
长文本与结构化表格占比高,要求日志需完整记录完整对话上下文与解析后的文档片段,避免截断导致审计信息缺失。专业术语与项目专属编号的高频使用,要求审计规则需匹配特定字段格式,确保敏感造价信息与项目标识可被精准追溯。更新频率无固定周期,要求日志需按项目维度自动归档,便于按项目周期完成全链路审计。大量工程数据的调用,要求日志存储需预留足够配额,避免因存储不足丢失关键审计记录。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 | |
|---|---|---|---|
LOG_RETENTION_DAYS | 180 天 | 基建项目周期通常较长,审计需追溯至少一个完整项目周期的对话记录 | |
AUDIT_REGEX_PATTERN | `^([A-Z]{2}\d{6} | \d{4}-\d{2}-\d{2})` | 匹配基建项目通用的标段编号与工期节点格式,精准触发审计规则 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 基建工程文档包含大量密集表格与扫描件,OCR与解析耗时显著高于通用文档 | |
MAX_LOG_ENTRY_SIZE | 20000 字符 | 基建投研对话的上下文通常包含完整的工程文档片段,需支持长文本日志存储 | |
LOG_STORAGE_QUOTA | 500 GB | 单项目的日志与文档解析缓存会占用较大存储,预留配额可避免存储溢出 | |
ENABLE_CHAT_LOGGING | 开启 | 基建投研涉及敏感造价信息,需完整记录所有对话调用用于审计溯源 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:部署v2版本后marker日志显示
ocr error。原因:基建工程文档包含大量带密集表格的扫描件,marker默认OCR阈值不足以识别表格内的文字内容。 - 现象:点击日志导出按钮报错,提示正则匹配失败。原因:配置的
AUDIT_REGEX_PATTERN未适配基建项目的标段编号格式,导致提取字段为空无法完成导出。 - 现象:实际有调用但
chat_log字段为空。原因:未开启ENABLE_CHAT_LOGGING参数,或配置的日志存储路径权限不足,无法写入对话记录。
怎么确认配好了
- 上传一份包含密集表格的基建工程扫描件,查看
chat_log中是否完整记录OCR解析后的文本与OCR耗时。 - 输入包含项目编号的投研提问,查看审计日志中是否触发了
AUDIT_REGEX_PATTERN的匹配规则。 - 等待10分钟后查看日志存储目录,确认新的对话记录已写入且未出现超时错误。
- 测试导出单条对话日志,确认正则匹配的项目编号字段能正确提取并显示在导出文件中。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。