这个品类的数据长什么样
国有大行智能尽调报告的数据来源主要包括内部信贷审批系统、人行征信中心报送文件、银保监会监管通报、上市公司公开财报及内部合规审计档案。数据更新节奏因类型不同有所区分:信贷类数据按业务发生实时或T+1更新,财报类按季度、年度固定更新,监管通报类随监管要求不定期更新。文档结构包含结构化表格(如授信额度明细表、逾期台账)、半结构化PDF(如监管评级报告)及纯文本合规文件。字段与单位方面,核心字段包括客户统一社会信用代码、授信余额(单位:万元)、逾期天数(单位:天)、监管评级(固定取值如A、B、C),部分字段需关联多份文档才能完整溯源。
这些特征在「引用来源与溯源」这一环带来什么约束
多源分散的数据源要求溯源系统需支持跨系统、跨文档的关联匹配,避免单一数据源的局限性。不同更新频率的数据需要配置增量同步与全量更新的切换逻辑,确保引用的内容为最新版本。结构化与半结构化混合的文档类型,要求解析环节需区分字段提取规则,对结构化数据自动绑定字段与单位,对半结构化数据需保留原文排版中的引用标记。国有大行的合规要求严格,溯源信息需同时包含文件名称、提取字段、字段值及唯一标识,任意环节缺失都会影响合规性。此外,海量的历史尽调数据要求溯源系统需支持快速定位关联文档,避免查询超时。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
recall_top_k | 前 10 条 | 国有大行尽调数据体量较大,需召回足够候选文档覆盖尽调场景的多维度问题 |
rerank_top_n | 前 3 条 | 需精准匹配尽调问题的核心字段,过多召回会导致溯源信息冗余,符合监管要求的简洁性 |
cite_source_type | file+metadata+field | 需同时展示引用文件名称、关联元数据及提取的具体字段与单位,满足合规溯源要求 |
parse_structured_field | 开启 | 结构化授信、逾期台账需准确提取字段及对应单位,避免溯源信息缺失单位信息 |
api_return_cite | 开启 | 需通过接口返回完整的引用ID与详情,适配工作流中工具调用的溯源展示需求 |
cite_format | [{{index}}] {{filename}} ({{field}}: {{value}} {{unit}}) | 按监管要求的格式展示溯源信息,明确标注字段与单位,避免歧义 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:工作流中工具调用连接知识库后,输出内容未显示任何引用来源。原因:未开启
api_return_cite配置,且工具节点未勾选返回引用参数,导致接口未返回引用字段。 - 现象:AI对话输出时,句末出现格式异常的引用标记,后续自动转为正常引号。原因:
cite_format配置中未正确转义特殊字符,或半结构化文档解析时字段提取异常,导致引用拼接出现格式错误。 - 现象:询问知识库中不存在的尽调问题时,仍返回历史文档的引用内容。原因:
recall_threshold设置过低,未开启无匹配查询时清空引用的逻辑,系统仍返回了默认召回的历史文档。
怎么确认配好了
- 发起包含明确字段查询的测试请求,检查接口返回的
citations字段是否包含文件名、提取字段、字段值及对应单位。 - 手动上传一份结构化尽调文档,触发解析任务,查看提取的字段是否正确标注单位,无缺失或错误。
- 发起无匹配知识库内容的测试查询,检查接口返回的
citations字段是否为空,或工作流中未生成引用内容。 - 查看工作流的工具调用节点配置,确认已勾选返回引用参数,且
cite_format配置无语法错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。