这个品类的数据长什么样
I 期临床研究的数据主要来源于研究者手册(Investigator's Brochure, IB)、临床研究方案(Clinical Study Protocol, CSP)、知情同意书(Informed Consent Form, ICF)以及病例报告表(Case Report Form, CRF)。这些文档通常以 PDF、Word 或扫描件形式存在。更新频率方面,IB 和 CSP 在研究进行中可能因方案修订而更新,CRF 数据则随受试者访视实时录入。文档结构高度规范,遵循 ICH GCP 指导原则。字段包括受试者筛选标准、剂量爬坡数据、药物代谢动力学(PK)参数、药效学(PD)指标、不良事件(AE)记录等。单位多样,如血药浓度常以 ng/mL 表示,剂量以 mg 或 μg/kg 表示,时间点以小时或天为单位。
这些特征在「对话日志与审计」这一环带来什么约束
I 期临床研发文档的高度规范性和敏感性,对对话日志与审计提出了严格要求。首先,文档更新频率虽然不高,但每次更新都可能涉及关键安全性或有效性数据,因此日志必须能追溯到文档版本,确保对话基于最新批准版本。其次,PK/PD 数据、AE 记录等关键字段的准确性至关重要,对话日志需记录 AI 对这些结构化信息的提取过程和置信度,便于人工复核。第三,受试者数据的敏感性要求日志系统具备严格的访问控制和匿名化处理能力,防止敏感信息泄露。对话中对剂量、AE 等关键信息的查询和回答,必须精确匹配原文,任何偏差都可能导致严重后果,审计时需能快速定位问题来源。最后,由于存在多种单位和数据类型,日志需要记录单位转换和数据聚合过程,确保结果一致性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8 | I 期文档关联性强,保持适中上下文避免无关信息干扰 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大文件解析耗时,预留充足时间防止超时中断 |
tokenLimit | 4096 | 兼顾文档长度与模型处理能力,避免上下文截断 |
logRetentionDays | 365 天 | 临床试验周期长,法规要求日志长期可追溯 |
敏感词过滤列表 | 自定义 I 期相关词汇 | 确保不当查询或回答被记录并标记 |
对话日志存储路径 | /var/log/fastgpt/clinical_dialogs | 统一管理日志,便于集中审计和备份 |
容易做错的三处
- 对话记录中部分关键数据字段为空,原因是对文档中特定格式的 PK/PD 数据提取规则不完善。
- 审计报告无法关联到具体的文档版本,原因是文档上传时未强制记录版本标识符
document_version_id。 - 多用户同时查询时,部分对话日志出现乱序或丢失,原因是日志写入机制未充分考虑高并发场景下的数据一致性。
怎么确认配好了
- 上传一份包含剂量爬坡数据和不良事件记录的模拟 I 期临床研究方案,确认 AI 能正确提取并回答相关查询,且对话日志完整记录了查询内容、AI 回复和引用的文档片段。
- 在审计界面,尝试通过关键词搜索特定的 PK 参数或 AE 报告,验证日志索引功能是否正常,并能准确定位到相关对话。
- 模拟一次文档更新,然后进行新旧文档的对比查询,检查对话日志中是否清晰显示了文档版本号
document_version_id,以及 AI 回答是否基于最新版本内容。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。