这个品类的数据长什么样
网络安全智能尽调报告的数据来源包括漏洞扫描归档、渗透测试记录、资产测绘数据集、合规审计文档等。更新节奏依类型区分,漏洞信息实时或每日更新,资产清单每周同步,合规报告按季度或年度更新。文档结构包含资产明细(IP地址、端口、组件版本)、漏洞详情(CVE编号、CVSS评分、修复方案)、合规项匹配结果、风险等级汇总等,字段含数字型端口号、CVSS分数,字符串型CVE编号、资产名称,以及时间型修复时限。
这些特征在「多轮对话与提示词」这一环带来什么约束
网络安全尽调报告的技术字段密集且关联性强,多轮对话需精准保留资产ID、CVE编号等关键标识,避免重复提问或混淆不同风险条目。数据更新频率较高,提示词需明确要求调用最新的知识库条目,确保回答匹配当前的漏洞修复状态。长文档占比高,需合理拆分文档并限定召回范围,避免无关的通用安全内容干扰对话逻辑,同时在多轮追问中自动关联上下文内的资产与风险信息,无需用户重复提供基础参数。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000–12000 字符 | 网络安全尽调报告包含长段技术描述与多资产条目,足够的上下文可保留多轮对话中的资产ID、CVE编号等关键信息 |
recallCount | 前 10 条 | 尽调报告需覆盖多维度风险,召回足够条目可匹配不同资产、漏洞的关联信息 |
similarityThreshold | 0.75–0.85 | 过滤低匹配度的非相关文档,避免混入无关的通用安全文档 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 大型渗透测试报告或资产测绘数据集解析耗时较长,避免超时中断训练 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 支持上传批量的漏洞扫描归档、合规报告等大体积文件 |
rerankTopK | 前 5 条 | 对召回结果重排后保留最相关的技术条目,提升多轮对话中回答的精准度 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传本地知识库文件后,数据处理阶段显示为空,无解析后的文本块。原因:上传的文件超过
UPLOAD_FILE_MAX_SIZE限制,或解析时长触发PARSE_FILE_TIMEOUT_SECONDS阈值,导致训练中断。 - 现象:工作流中知识库搜索节点调试正常,但AI对话环节未参考配置的尽调报告内容,仅返回通用问答。原因:
similarityThreshold设置过高,过滤掉了尽调报告中的专属风险匹配结果,或未开启知识库关联开关。 - 现象:调用对话接口后,MongoDB对应集合中未生成
conversation_id、query、response字段,无法查看对话历史。原因:未开启对话历史存储配置,或接口请求未携带有效的会话标识参数。
怎么确认配好了
- 上传一份小型网络安全漏洞报告,检查数据处理阶段是否生成解析后的文本块,确认
UPLOAD_FILE_MAX_SIZE与PARSE_FILE_TIMEOUT_SECONDS配置生效。 - 发起多轮对话,先询问某资产的CVE编号,再追问对应修复建议,检查回答是否关联首次提问的资产与漏洞编号,确认
maxContext配置保留上下文信息。 - 调用对话接口,检查返回结果中是否包含
knowledge_retrieved字段,确认知识库召回逻辑正常触发。 - 查看MongoDB对应集合,确认存在
conversation_id、query、response等字段,确认对话历史存储配置已开启。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。