这个品类的数据长什么样
抗体偶联药物(ADC)临床试验预筛的数据来源多样,主要包括公开的临床试验注册库(如 ClinicalTrials.gov、欧洲药品管理局 EudraCT 数据库)、药企发布的临床研究报告、学术期刊论文、以及专利数据库。这些数据通常以结构化与非结构化混合的形式存在。结构化数据包括试验设计、入组标准、药物剂量、治疗周期、研究终点等,常以表格或字段形式呈现。非结构化数据则包含研究方案的详细描述、患者招募信息、不良事件报告、伦理审查文件等,多为自由文本或 PDF 文档。数据更新频率不一,临床试验注册库可能每周更新,而学术论文与研究报告则有滞后性。ADC 药物的特殊性在于其包含抗体、连接子与细胞毒素三个部分,因此数据中会涉及靶点、偶联方式、载药比(DAR值)等特有字段与单位,例如 DAR 值通常以整数表示,反映每个抗体分子上偶联的细胞毒素分子数量。
这些特征在「引用来源与溯源」这一环带来什么约束
ADC 临床试验预筛数据的多样性与复杂性,对引用来源与溯源机制提出了具体要求。首先,数据来源的广泛性意味着知识库需整合来自不同平台与格式的数据,引用时需要清晰标明原始出处,例如是来自 ClinicalTrials.gov 的 NCT 号码,还是某篇 DOI 标识的学术论文。其次,混合的结构化与非结构化数据要求引用不仅能指向文档,还能精确到文档内的特定段落或表格行。特别是对于 ADC 特有的靶点、DAR 值等关键字段,溯源机制必须能够识别并链接到这些信息的原始记录。更新频率的差异使得引用内容可能存在时效性问题,系统需要具备版本管理能力,并能在引用时提示数据的更新状态。此外,由于ADC药物研发的专业性,自由文本描述中常包含大量医学术语与缩写,这要求引用系统具备一定的语义理解能力,以确保溯源的准确性,避免因术语歧义导致引用错误。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾 ADC 临床试验方案的段落完整性与检索效率,避免切分关键信息 |
召回条数 | 前 8-12 条 | 考虑到 ADC 临床试验预筛的复杂性,需要更多候选结果以提升召回率 |
相似度阈值 | 0.75-0.85 | 排除无关内容,同时保留语义接近但表述不完全一致的临床试验信息 |
重排返回条数 | 前 5 条 | 结合 ADC 靶点、DAR 值等核心信息,精选最相关的引用片段 |
最大引用令牌数 | 1024 token | 保证引用内容足够支撑 ADC 临床试验预筛决策,避免信息截断 |
ENABLE_REFERRAL_DOC_ID | true | 确保每次引用都能返回原始文档的唯一标识符,便于追溯源文件 |
容易做错的三处
- 模型返回的引用片段与用户问题语义关联度低,导致决策依据不充分。这是因为
相似度阈值设置过高或召回条数过少,未能充分检索到所有潜在相关信息。 - 引用来源指向的文档内容与实际回答不符,或引用的
NCT号码、DOI标识无法在原始数据库中找到。这通常是由于知识库数据清洗不彻底或数据同步延迟,导致引用元数据与实际内容脱节。 - 在需要引用特定 ADC 药物的
DAR值或靶点信息时,模型无法精确指出其来源文档的具体位置。这可能是因为分段长度设置不当,导致关键信息被截断或分散在不同段落,影响了精确定位。
怎么确认配好了
- 针对典型 ADC 临床试验预筛问题,例如“寻找 HER2 阳性乳腺癌患者使用 T-DM1 的临床试验,要求 DAR 值在 3.5 左右”,检查返回的引用是否包含正确的
NCT号码或DOI,并能指向原始文档中关于 HER2、T-DM1 和 DAR 值的描述。 - 随机抽取 10-20 条模型生成的引用,手动核对引用片段与原始文档内容的匹配度,确保引用的准确性与完整性。同时检查引用的元数据(如文件名、来源平台)是否正确无误。
- 模拟数据更新场景,例如某个临床试验状态从“招募中”变为“已完成”,观察模型在引用该试验时,能否返回最新的状态信息,并能准确溯源到最新的数据版本。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。