这个品类的数据长什么样
稳定性研究的数据主要来源于药品的长期稳定性试验报告、加速稳定性试验报告以及强制降解试验报告。这些报告通常是 PDF 格式的文档,或结构化的 Excel 表格。数据更新频率相对较低,通常在药品的研发、注册和上市后监测阶段按计划进行。文档结构复杂,包含详细的试验条件(温度、湿度、光照)、样品批次信息、检测项目(含量、杂质、溶出度等)、检测方法、检测结果以及统计分析。字段包括批号、生产日期、检测时间点(如 T=0, T=3M, T=6M)、检测值(如 含量 %、杂质 A %)和单位(如 mg/mL、%)。
这些特征在「向量模型与索引」这一环带来什么约束
稳定性研究报告的复杂文档结构和多时间点数据,要求向量模型能有效捕捉时间序列信息和不同检测项目之间的关联。由于报告中常包含表格数据,传统的分块策略可能导致表格被截断,影响语义完整性。字段名称和单位的多样性,对实体识别和标准化提出了挑战,需要预处理阶段进行清洗和统一。数据更新频率低,意味着知识库构建后,主要关注增量更新和版本管理。对于临床试验预筛而言,需要快速比对候选药物与已知稳定性数据,因此召回效率和准确性至关重要。向量模型需具备区分微小但关键的数值差异的能力,例如在杂质含量波动上的细微变化。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 300–500 字符 | 稳定性报告中包含大量表格和结构化文本,过长的分段可能导致多个不相关的检测数据混杂;过短则可能破坏单个检测结果的上下文。此范围有助于保持单条检测结果的语义完整性,同时避免过大的向量尺寸。 |
分段重叠 | 50 字符 | 确保相邻分段之间存在一定重叠,以捕获跨分段的上下文信息,特别是对于表格行之间的关联。 |
embedding_model | Qwen/Qwen3-Embedding-8B | 考虑其在中文生物医药领域的表现和上下文理解能力,对复杂的技术文档有较好的处理效果。 |
召回条数 | 8–12 条 | 稳定性数据比对需要较高的精确度,适当增加召回条数可以提高相关结果的覆盖率,减少漏检风险。 |
相似度阈值 | 0.75–0.85 | 稳定性研究中的数值差异通常具有重要意义,需要较高的相似度阈值来确保召回结果的精确性,避免无关或低相关度的信息干扰。具体值需要通过实际数据进行标定。 |
重排返回条数 | 3–5 条 | 在初步召回后,通过重排模型进一步精炼结果,确保返回给用户的最终结果是最相关的。减少最终返回条数可提高用户体验,避免信息过载。 |
容易做错的三处
- 知识库构建后,查询结果返回大量不相关的稳定性报告或数据,通常是因为
相似度阈值设置过低,导致召回了大量低相关度的文档片段。 - 查询特定批次或时间点的稳定性数据时,结果中缺失关键信息或数据不完整,这可能是由于
分段长度设置不当,导致单个检测结果的上下文被截断或表格数据被错误拆分。 - 在添加新的稳定性报告时,系统提示
embedding_model配置冲突或版本不兼容,这通常是因为尝试为同一个模型名称配置了不同的参数或版本,系统默认只保留最新配置。
怎么确认配好了
- 选择一份典型的稳定性研究报告,进行知识库构建,并验证报告中的关键信息(如特定时间点的含量、杂质数据)是否能被准确分段和索引。
- 针对多个批次或不同试验条件下的相似药物,进行跨报告查询,检查返回结果的准确性和完整性,特别关注数值型字段的匹配情况。
- 模拟临床试验预筛的查询场景,输入包含特定稳定性要求的查询语句,评估召回结果的相关性和排序效果,确保最重要的稳定性数据排在前列,并根据业务需求调整
相似度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。