这个品类的数据长什么样
数据来源包括CVE漏洞库、公开安全厂商技术公告、行业安全应急响应报告、企业内部安全审计文档。更新节奏随安全事件实时推进,重大漏洞发布后数小时内即有更新文档。文档结构包含漏洞编号、CVSS评分、攻击向量、影响资产范围、修复措施、关联攻击案例等字段,部分文档为纯技术文本段落,无固定格式。单位包括CVSS评分(0-10分)、影响资产数量(台/系统)、发布时间戳(ISO 8601格式)。
这些特征在「向量模型与索引」这一环带来什么约束
多源异构的数据格式要求向量模型兼顾结构化字段编码与非技术文本语义匹配,避免出现技术术语编码偏差;实时更新的安全事件需要索引支持增量刷新,避免全量重建带来的性能损耗;长文本的攻击流程分析需要合理的分段策略,避免破坏跨段落的攻击链上下文关联;多字段关联的检索需求要求索引支持元数据过滤,精准定位特定类型的安全研报。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 网络安全研报常包含长段的漏洞分析和攻击流程,过长会丢失上下文,过短会破坏攻击链逻辑 |
chunk_overlap | 150–200 字符 | 需要保留跨分段的攻击步骤关联信息,避免检索时断裂 |
recall_top_k | 前 10–15 条 | 安全问题往往关联多个漏洞或攻击事件,需要足够的召回量覆盖关联信息 |
vector_db_batch_size | 32–64 条/批次 | 网络安全研报数据量增长快,批量处理可平衡索引速度与内存占用 |
embedding_model | bge-m3 或 text-embedding-3-large | 需要适配多字段(如CVSS评分、攻击向量)的语义匹配,这两款模型对技术文本的编码效果较好 |
index_refresh_interval | 5 分钟 | 安全事件更新频繁,需要准实时的索引刷新来保证检索时效性 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:docker-compose部署环境下,索引任务长时间未完成,日志出现
OOM killed报错。原因:未调整vector_db_batch_size参数,批量处理时内存占用超出容器配额。 - 现象:已在模型渠道添加ollama qwen2.5与bge-m3模型,但创建知识库时文本理解模型下拉框无对应选项。原因:未将嵌入模型绑定至知识库的向量检索配置项,仅完成了大语言模型的渠道配置。
- 现象:向量化后的数据集检索返回空结果,接口返回
status_code: 400错误。原因:未根据研报长度调整chunk_size参数,长文本被过度截断导致语义断裂。
怎么确认配好了
- 查看向量数据库容器日志,无
OOM、连接超时或索引失败的报错信息。 - 上传单份网络安全研报,查看分段预览界面,确认分段保留了完整的攻击步骤与漏洞编号等关键信息。
- 发起检索测试,输入测试关键词,检查召回结果包含匹配的漏洞编号、修复方案等核心内容。
- 上传新的安全研报,等待索引任务完成后,再次发起检索,确认新内容已被覆盖。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。