这个品类的数据长什么样
供应商审计在临床试验预筛阶段,数据主要来源于审计报告、资质证明、质量管理体系文件、既往项目合作评估、现场考察记录、以及供应商提交的各类技术文档。这些文档格式多样,包括 PDF 格式的审计报告扫描件、Word 或 Excel 格式的质量体系文件、PNG 或 JPG 格式的证书图片,以及结构化数据如供应商基本信息数据库导出文件。数据更新频率不一,资质证明可能每年更新,审计报告通常在完成审计后生成,而质量管理体系文件可能根据内部流程变化或法规要求进行修订。文档结构复杂,例如审计报告通常包含执行摘要、发现、建议、回复等章节,且可能含有表格和图表。字段和单位方面,涉及合规性等级、缺陷分类、风险评分、认证有效期、设备校准日期、人员培训记录等,具体数值和文本描述并存。
这些特征在「工作流编排」这一环带来什么约束
供应商审计数据的多样性和复杂性,对工作流编排提出了具体要求。PDF 扫描件和图片需要 OCR 识别,以提取文本内容,这增加了预处理环节的计算负担和潜在的识别错误。Word 和 Excel 文档的结构化信息提取需要更精细的解析策略,以区分正文、表格和列表。数据更新频率的不确定性,要求工作流支持增量更新和版本管理,避免重复处理和数据冗余。文档的复杂结构,特别是审计报告,决定了知识库构建时需要考虑语义分块,确保上下文的完整性,例如将审计发现与对应的供应商回复关联起来。字段和单位的混杂,意味着在信息提取后,需要进行标准化处理,例如将不同的日期格式统一,或将文本描述映射到预定义的分类体系,以支持后续的自动化评估和决策。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
文件类型白名单 | pdf, docx, xlsx, png, jpg | 覆盖常见的审计文档和资质证明格式,确保文件可被上传处理。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型审计报告和复杂结构文档的解析需求,避免因超时导致解析失败。 |
分段长度 | 800–1200 字符 | 平衡上下文完整性和模型输入限制,确保每个分段包含足够的语义信息。 |
召回条数 | 前 5-8 条 | 考虑到审计场景下,通常需要从多个维度进行交叉验证,增加召回条数有助于全面性。 |
相似度阈值 | 按实测标定 | 依据具体审计问题的敏感度,通过测试确定既能召回相关信息又不引入过多噪音的阈值。 |
重排返回条数 | 前 3 条 | 在初次召回的基础上,通过重排进一步优化结果,聚焦最相关和关键的信息。 |
容易做错的三处
- 知识库查询结果为空或不完整,现象是模型无法回答与上传文件强相关的问题。原因在于文档解析节点未能正确识别和提取所有关键信息,尤其对于表格或图片中的文本内容。
- 工作流执行超时或报错,现象是数据库连接工具使用变量时出现错误。原因在于变量类型或格式与数据库期望不符,或 SQL 查询语句存在注入风险,导致执行失败。
- 模型在对话中无法根据用户选择实时切换知识库,现象是对话机器人无法精准响应特定审计阶段的问题。原因在于工作流编排中未设计动态知识库选择逻辑,或知识库路由规则不明确。
怎么确认配好了
- 上传具有代表性的供应商审计报告、资质证明,验证文档解析节点是否能完整、准确地提取所有文本内容,特别是表格和扫描件中的信息。
- 设计包含变量的数据库查询场景,执行工作流,确认数据库连接工具能正确处理变量并返回预期结果。
- 在对话界面进行模拟审计提问,尝试引导对话切换到不同的供应商或审计主题,验证工作流是否能根据对话上下文动态选择并查询相应的知识库。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。