这个品类的数据长什么样
稳定性研究的数据主要来源于药企内部的质量管理体系文件,包括稳定性研究方案、稳定性试验报告、变更控制文件和偏差处理报告等。这些文档通常以 PDF、Word 或扫描件的形式存在,内容结构化程度不一。更新频率方面,新药研发阶段可能月度更新,上市后则根据年度回顾或变更触发。文档中包含大量专业术语、图表、批次信息、时间点、温度/湿度条件以及具体检测数据(如含量、溶出度、杂质等)。字段单位多样,例如含量常以 % 计,杂质以 ppm 或 g/L 计,时间以月、日、小时计,温度以 ℃ 计。
这些特征在「向量模型与索引」这一环带来什么约束
稳定性研究文档的多样性和专业性对向量模型与索引提出了特定要求。文档中包含的图表和扫描件需要 OCR 技术进行文本提取,确保信息不丢失。更新频率决定了索引的重建或增量更新策略,以保持知识库的时效性。大量的专业术语和缩写,如 API(活性药物成分)、ICH(国际人用药品注册技术协调会),要求向量模型具备良好的领域语义理解能力,能够区分上下文中的多义词。此外,批次号、时间点等关键实体识别能力对于精准召回特定稳定性批次的信息至关重要。结构化数据与非结构化文本的混合,也要求索引策略能有效处理不同类型信息的融合与检索。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 500-800 字符 | 兼顾上下文完整性与向量表示的精确性,避免过长的块稀释关键信息或过短的块丢失语境。 |
overlap_size | 100-150 字符 | 确保块与块之间存在足够的上下文重叠,提高跨块信息召回的连贯性。 |
embedding_model | 领域优化模型或通用大模型 | 稳定性研究涉及大量专业术语,领域优化模型能更好地捕捉语义;通用大模型在上下文理解上有优势。 |
recall_top_k | 5-10 条 | 平衡召回效率与相关性,确保覆盖潜在相关信息,并为后续重排提供足够候选。 |
similarity_threshold | 按实测标定 | 根据实际召回效果与误召回率进行调整,通常在 0.75-0.85 之间,确保结果相关性。 |
parser_config.ocr_enabled | true | 大量稳定性报告为扫描件,启用 OCR 是获取文本内容的关键。 |
容易做错的三处
- 索引构建后查询结果不相关,现象是返回的文本片段与问题表述没有直接关联。原因在于切块粒度过大或过小,导致关键信息被稀释或上下文割裂,未能有效捕捉稳定性研究中的核心语义。
- 部分稳定性报告内容无法被检索到,表现为查询特定批次或日期的数据时没有结果。原因是文档解析阶段未充分处理扫描件或图片中的文本,
parser_config.ocr_enabled参数未正确配置或 OCR 识别效果不佳。 - 数据更新后,查询仍返回旧信息。这是因为知识库的增量更新机制未被触发,或者更新频率与实际数据变化频率不匹配,导致索引未能及时同步最新的稳定性研究数据。
怎么确认配好了
- 选取多个具有代表性的稳定性研究问题,例如查询特定批次药品的杂质变化趋势,观察召回结果是否包含关键的批次号、检测日期和相关数据。
- 随机抽取一批包含扫描件的稳定性报告,上传并索引,然后查询其中特有的文本内容,检查是否能准确召回,以此核对 OCR 功能的有效性。
- 对一个已建立索引的稳定性研究方案进行内容修改(如更新某个检测标准),然后重新触发索引更新,查询修改后的内容,确认知识库的时效性阈值是否合理。
- 通过 FastGPT 提供的调试界面,检查向量相似度分数和召回的原始文本块,判断
chunk_size和overlap_size配置是否得当,并根据实际语义相关性调整similarity_threshold。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。