这个品类的数据长什么样
网络安全投研数据主要来自公开漏洞库、威胁情报平台、行业合规文档、攻防演练报告。数据更新节奏差异较大:漏洞信息实时推送,合规文档按季度更新,攻防分析报告不定期发布。文档包含结构化字段如CVE编号、CVSS评分、受影响组件,以及非结构化的攻击溯源日志、合规细则文本。部分文档存在长段落的技术细节描述,字段需遵循安全领域的标准命名规范。
这些特征在「引用来源与溯源」这一环带来什么约束
结构化的CVE编号、CVSS评分等字段要求溯源时精准匹配对应条目,避免泛化引用。实时更新的漏洞数据要求溯源环节同步更新源数据的时间戳,确保引用的是最新版本。长段落的技术细节文本需要拆分后保留原文锚点,避免溯源时丢失原始内容位置。不同版本的行业合规文档需在溯源信息中附加版本标识,防止引用过时条款。攻击日志类非结构化数据需关联唯一事件标识,确保溯源可追溯到具体攻防场景。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 网络安全文档多包含长日志片段、完整攻防报告,需支持较大单文件上传 |
PARSE_FILE_TIMEOUT_SECONDS | 1200 秒 | 长日志、合规文档的解析耗时较长,避免因超时导致解析失败 |
分段长度 | 800–1200 字符 | 平衡安全文档的技术细节完整性和召回精度 |
召回条数 | 前 8–10 条 | 覆盖多维度威胁情报、漏洞信息的投研需求 |
相似度阈值 | 0.72–0.85 | 区分相似漏洞的受影响版本、攻击手法差异 |
重排返回条数 | 前 3–5 条 | 避免过多冗余的同源威胁情报引用 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:部分导入的安全文档未生成问答对,直接以原文片段存入知识库。原因:未开启
ENABLE_QA_PAIR_GENERATE参数,或PARSE_FILE_TIMEOUT_SECONDS设置过短,导致长文档解析中断。 - 现象:配置第三方模型后测试弹出报错,强行忽略后可正常生成引用。原因:模型接口返回格式未适配安全领域长文本输出,校验逻辑误判为异常,常见错误提示包含
400 Bad Request状态码。 - 现象:知识库包含多文档时,简单应用仅返回1条引用结果。原因:
召回条数设置过低,且未开启跨文档召回的全局配置,适配FastGPT v4.8.22及以上版本需额外调整对应开关。
怎么确认配好了
- 上传单份包含CVE编号的安全文档,查看知识库解析后的元数据是否包含对应标准字段。
- 发起测试查询,检查返回结果的引用栏是否附带文档名称、原文锚点位置及更新相关标识。
- 导入多份不同类型的安全文档,验证不同文档的引用信息可被正确区分。
- 调整
召回条数参数后,发起批量查询,确认返回的引用条数符合配置预期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。