这个品类的数据长什么样
罕见病注册申报资料的数据来源多元,包括药物临床试验报告、非临床研究报告、药物生产与质量控制文件、以及监管机构发布的指南与法规文件。这些文档的更新频率不一,临床试验数据通常在试验结束后集中发布,而监管法规可能每年修订或不定期发布补充条款。文档结构复杂,例如临床试验报告常包含摘要、研究方法、结果、讨论等多个章节,且可能包含大量图表与附件。字段与单位方面,药物剂量以毫克(mg)、微克(ug)计,试验周期以天(days)、周(weeks)计,生物标志物浓度以纳摩尔每升(nmol/L)计,并常伴随统计学指标如 p-value、CI 区间。
这些特征在「多轮对话与提示词」这一环带来什么约束
罕见病数据的高度专业性与分散性,对多轮对话的上下文管理提出了挑战。由于术语复杂且专业,模型需要精确理解用户意图,避免因知识库召回不准确而导致对话偏离主题。文档结构复杂意味着单一的关键词匹配不足以支撑有效的知识检索,需要更强的语义理解能力。频繁的法规更新要求知识库具备高效的同步机制,确保对话内容的时效性。此外,不同报告中单位与字段的标准化程度不一,可能导致数据提取困难,影响提示词生成质量。例如,用户询问特定药物的 pk 曲线数据时,系统需能从非标准化的图表描述中提取有效信息,并准确呈现。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2000 字符 | 确保在多轮对话中能够保留足够长的上下文,以应对罕见病申报资料中专业术语多、背景信息复杂的特点。 |
召回条数 | 8 条 | 考虑到罕见病知识库文档通常较大且关联性强,增加召回条数有助于覆盖更全面的信息,避免遗漏关键细节。 |
相似度阈值 | 0.78 | 罕见病领域的专业术语与概念区分度高,较高的阈值有助于筛选出与用户查询高度相关的文档片段,减少无关信息干扰。 |
重排返回条数 | 4 条 | 经过召回和重排后,精选出最相关的少量条目,以保证提示词的质量和相关性,避免过载。 |
分段长度 | 500 字符 | 罕见病文档内容密度大,适中的分段长度有助于在保持语义完整性的前提下,提高检索效率和模型处理能力。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 注册申报资料文档通常包含大量文本和复杂格式,延长解析超时时间可以确保大型文件的完整处理。 |
容易做错的三处
- 对话中频繁出现“我没有找到相关信息”或内容重复,原因在于
相似度阈值设置过高,导致相关但非精确匹配的知识点被过滤,或者召回条数过少,未能覆盖足够的信息。 - 用户提问特定药物的剂量单位时,返回结果单位不统一或缺失,原因是知识库在文档预处理阶段未对
mg、ug等单位进行标准化识别和标注,导致模型无法准确提取。 - 对话中对最新法规进展的询问,系统仍基于旧版本信息回答,原因是知识库更新机制不及时,导致
fastgpt所依赖的文档版本滞后于实际更新。
怎么确认配好了
- 选择一个包含多轮问答场景的罕见病注册申报案例,测试对话流程是否能持续理解上下文,并给出连贯且相关的回答。
- 针对多个带有特定剂量、时间单位的罕见病药物临床数据提问,检查系统返回的结果是否准确包含单位信息,并能进行简单的单位换算。
- 模拟罕见病监管法规更新后的提问,确认系统返回的信息已是最新版本,并能引用正确的法规条文号。
- 通过查询特定罕见病的治疗方案或不良反应,验证系统能否从多个文档类型中(如临床报告、药品说明书)综合提取信息,并形成有逻辑的回答。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。