这个品类的数据长什么样
CMC 研究数据主要来源于实验室分析报告、生产批记录、质量标准文件、稳定性研究报告以及法规申报材料。这些数据通常以非结构化文档(如 PDF、Word、扫描件)和半结构化数据(如 Excel 表格、CSV 文件)的形式存在。数据更新频率不一,批生产记录通常随批次生成,稳定性数据则按预设时间点(如 0、3、6、12、24、36 月)持续更新。文档结构复杂,包含大量专业术语、图表和化学结构式。字段方面,涉及物质名称、批号、生产日期、有效期、含量、纯度、杂质谱、溶剂残留、pH 值、熔点等,单位涵盖百分比(%)、ppm、mg/mL、℃、小时、天等,且常伴随检测方法、检测限、合格范围等附加信息。
这些特征在「工具调用与插件」这一环带来什么约束
CMC 研究数据的多源性和异构性,对工具调用与插件的健壮性提出了要求。非结构化文档需要强大的文件解析能力,以准确提取关键信息,例如 FastGPT 的文件处理插件需要能够识别并解析 PDF 中的表格和文本内容。半结构化数据则要求工具能够灵活适配不同的数据格式和字段定义。更新频率的不确定性意味着工具调用需要支持异步处理和状态回调机制,避免长时间阻塞。文档的复杂性,特别是化学结构式和专业术语,要求工具在文本嵌入和相似度计算时能有效处理这些特有信息,可能需要定制化的词向量模型或预处理步骤。字段与单位的严格性,则约束了工具在提取和传递参数时必须保证数据类型和单位的正确性,任何偏差都可能导致结果错误或误判。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 考虑到 CMC 报告常包含大量图表和扫描件,文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂 PDF 文档和图像识别通常需要较长时间,避免解析中断。 |
maxContext | 8192 token | 确保能够容纳单份 CMC 报告的关键信息,便于模型理解上下文。 |
分段长度 | 800–1200 字符 | 平衡上下文完整性和检索效率,避免单个分段过长或过短。 |
召回条数 | 前 10 条 | 增加从知识库召回相关片段的可能性,提高答案的准确性。 |
相似度阈值 | 0.75 | 针对 CMC 领域专业性强、术语固定的特点,提高相似度匹配的严格性。 |
容易做错的三处
- 工具调用接口返回
400 Bad Request错误,内容提示Invalid parameter type for 'batch_id'。原因可能是文件类型的变量在 API 调用时,未能正确将文件上传后的 ID 传递给对应的参数,而是尝试传递文件内容或文件名字符串。 - 模型在回答中频繁出现“无法获取到相关信息”或“信息不完整”,即使知识库中存在相关文档。原因可能是文件解析插件对文档中的表格或特定格式的数据提取不完整,导致关键字段未能被有效索引。
- 通过 API 调用插件,设置
stream为true后,最终结果无法完整接收或接收中断。原因可能是客户端对流式响应的处理机制不完善,未能正确拼接所有数据块,或者在网络波动时未实现断点续传。
怎么确认配好了
- 上传一份包含复杂表格的 CMC 报告 PDF,检查知识库中该文档的分段内容,确保表格数据被准确识别并转化为可检索的文本。
- 模拟一次 CMC 产品咨询,提问报告中的关键含量、杂质等信息,核对模型回答与原始文档中的数据是否一致,特别是单位和数值。
- 通过 API 调用插件,传递一个包含文件类型参数的请求,检查日志中文件 ID 是否正确传递,并监控工具执行过程是否正常返回结果。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。