这个品类的数据长什么样
皮肤科药物警戒数据主要来源于临床试验报告、真实世界研究、病例报告、患者反馈以及药品说明书。这些数据更新频率较高,尤其是新药上市后,不良反应报告会持续涌现。文档结构多样,包括结构化的病例报告表(CRF)、半结构化的医学文本(如医生手写病历、诊疗记录)和非结构化的自由文本(如患者自述、社交媒体讨论)。字段与单位特异性强,例如皮肤病变描述涉及形态学特征(斑疹、丘疹、水疱)、大小(毫米、厘米)、颜色(红斑、紫癜)、分布(局限、泛发),以及特定的医学术语和评分量表(如 SCORAD 评分、EASI 评分)。
这些特征在「文档解析与分块」这一环带来什么约束
皮肤科数据来源广泛,结构化程度差异大,对文档解析的鲁棒性提出要求,需要处理图像内嵌文本、手写识别等场景。高频更新特性意味着知识库需支持增量更新与快速索引,以捕捉最新的不良反应信息。文档中包含大量医学专有名词、缩写和多语言混杂现象,对分词器的词汇覆盖率和多语言处理能力是挑战。皮肤病变描述的高度细致化和量表评分的存在,要求分块策略能够保留描述的完整性,避免在关键信息点处截断,同时需识别并提取数值型数据,确保单位的正确关联。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 兼顾皮肤病变描述的完整性与召回效率,避免过度细碎导致语境丢失。 |
overlap_size | 100–200 字符 | 确保相邻分块之间有足够上下文重叠,提高召回的连贯性。 |
max_tokens | 4000 tokens | 适应医学文本的冗长特性,确保单个请求能够处理较长的病历或报告。 |
parse_image_text | 启用 | 皮肤科文档常包含皮损图片及图注,需识别提取图片中的文本信息。 |
custom_stopwords | 添加医学专有名词 | 排除常见的、对RAG无贡献的医学停用词,提升语义匹配精度。 |
timeout_seconds | 600 秒 | 处理大型PDF报告或OCR识别任务时,预留充足的解析时间,避免中断。 |
容易做错的三处
- 上传大型PDF文档后,问答准确度不高,日志显示
chunk_size过小或分块内容丢失,原因在于默认分块策略未能有效处理复杂多列布局或图文混排的皮肤科报告,导致关键信息被截断。 - 数据库连接配置正确,但系统生成的SQL查询报错,原因是解析结果自带标点符号或非标准字符,导致SQL语句语法错误。
- 上传Excel表格后,系统无法理解表格内容,问答结果为空,原因是未指定
table_parsing_strategy或选择了不适合多列医学数据表的自动分段策略,导致行与行之间的逻辑关联被破坏。
怎么确认配好了
- 选择典型病例报告或药品说明书进行上传,检查解析后的分块内容,确认关键症状、诊断、治疗方案、不良反应描述是否完整且逻辑连贯。
- 对比原始文档与解析结果,验证图片中的文本、表格数据是否被准确提取并纳入分块,尤其关注皮肤病变描述的形态、大小、颜色等细节。
- 随机抽取多个分块,进行关键词搜索和问答测试,评估召回结果是否包含预期信息,并检查召回内容的上下文是否充足。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。