这个品类的数据长什么样
网络安全投研的数据来源包括公开漏洞库、威胁情报报告、攻防演练日志、合规文档与厂商技术白皮书。数据更新节奏覆盖实时(零日漏洞披露)、定期(厂商安全周报)与突发(高危漏洞通告)三类。文档结构包含结构化条目(如带CVE编号、CVSS评分的漏洞详情)、半结构化的攻防分析报告(含攻击路径、样本哈希)与非结构化技术文档(长文本、代码片段、日志片段)。核心字段包括CVE ID、CVSS评分、影响组件版本、样本哈希值,单位包含评分数值、十六进制哈希字符串与时间戳。
这些特征在「文档解析与分块」这一环带来什么约束
结构化漏洞条目需要精准提取固定字段,避免被非结构化内容干扰;半结构化攻防报告需按攻击阶段或段落拆分,不能破坏攻击路径的逻辑连贯性;实时更新的漏洞数据要求解析流程具备低延迟特性,避免因超时导致任务中断;样本哈希、组件版本等强格式字段需保留原始编码,防止自动转义导致检索失效;混合格式文档需适配多类解析逻辑,无法采用统一的分块规则。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 适配长文本攻防报告与多页PDF的解析耗时,避免超时中断任务 |
chunk_size | 800–1200 字符 | 平衡漏洞字段提取精度与投研上下文完整性,避免拆分破坏攻击路径逻辑 |
chunk_overlap | 100–150 字符 | 保留跨分块的漏洞影响范围关联信息,防止上下文断裂 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 支持大型攻防演练日志归档与全量漏洞库文档上传 |
ENABLE_MARKDOWN_PARSE | 开启 | 保留技术文档中的代码块、表格格式,便于后续投研检索 |
FORMULA_PARSE_MODE | 按内容触发 | 适配安全文档中少量CVSS评分计算式的解析需求,避免不必要的开销 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 执行
docker run --gpus all -itd -p 7231:7231启动marker_images:v0.1时出现报错,原因是本地环境的CUDA版本与镜像版本不兼容,导致GPU解析依赖加载失败。 - 知识库里的PDF文档点击分块预览时返回“无法读取该文件内容”,原因是文档存在加密权限或内嵌非标准字体,导致解析引擎无法提取文本内容。
- 飞书知识库同步PPT和PDF文档失败,原因是飞书开放接口未配置文档读取权限,或文档为加密版PPT,无法被解析引擎拉取内容。
怎么确认配好了
- 上传一份包含CVE条目、攻防日志片段的混合文档,检查解析后的文本是否完整提取了核心字段。
- 查看解析任务的日志,确认解析耗时未超过
PARSE_FILE_TIMEOUT_SECONDS的配置值,无超时报错。 - 触发飞书知识库的同步任务,检查PPT与PDF文档是否出现在知识库的文档列表中,且可正常预览分块内容。
- 对比
4.8.12与4.9.0版本的解析效果,确认公式解析功能在长文本场景下可正常返回结果,无异常。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。