这个品类的数据长什么样
药物经济学研究文档主要包含成本效益分析、成本效果分析、成本最小化分析和成本效用分析报告。数据来源多为全球各国的卫生技术评估(HTA)机构发布的官方报告、临床试验数据报告、真实世界证据(RWE)研究以及药企内部的市场准入策略文档。这些文档的更新频率相对较低,通常随新药上市、适应症扩展或国家医保政策调整而发布,年均更新量不大。文档结构高度规范化,通常包含摘要、背景、方法学(模型建立、参数选择、敏感性分析)、结果、讨论和结论等章节。数据字段涉及药物价格、治疗成本、疾病负担、质量调整生命年(QALYs)、增量成本效益比(ICER)等,单位以货币(美元、欧元、人民币)、时间(年、月)、比率(%)和效用值(QALY)为主。
这些特征在「部署与升级」这一环带来什么约束
药物经济学文档的规范化结构和特定字段要求,决定了在部署时需重点关注解析模型的准确性和字段映射的严谨性。由于文档更新频率不高,初始部署阶段的数据清洗和预处理工作量相对较大,但后续增量更新压力较小。文档中包含大量表格和图表数据,对 PDF 或图片解析能力提出较高要求,特别是涉及到复杂模型参数和敏感性分析结果的提取。特定术语和单位的存在,要求模型在语义理解层面具备较高的专业性,避免混淆。部署时需要预留足够的存储空间以应对原始文档和结构化数据,同时考虑到未来可能增加的报告类型。升级时,主要关注模型对新报告结构和新字段的适应性,以及解析效率的提升。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 药物经济学报告通常篇幅较长,包含复杂图表和表格,需要更长的解析时间。 |
分段长度 | 800–1200 字符 | 确保每个分段包含足够的上下文信息,便于理解复杂的经济学论证。 |
重叠长度 | 150 字符 | 保证分段间的语义连贯性,避免关键信息被截断。 |
maxContext | 8192 | 应对复杂查询时,提供充足的上下文窗口以进行深入分析和推理。 |
相似度阈值 | 0.75 | 提高检索的精准性,减少不相关信息的干扰,匹配专业术语。 |
UPLOAD_FILE_MAX_SIZE | 100 MB | 考虑到报告可能包含大量嵌入图表和高清图片,文件体积较大。 |
容易做错的三处
- 现象:提取出的 ICER 值或 QALY 值为空或格式错误。原因:解析器未能正确识别报告中特定表格或文本段落的数值格式,未能进行有效的数据清洗。
- 现象:MongoDB 连接失败,日志显示
authentication failed。原因:MONGODB_URI配置中数据库名称、用户名或密码不正确,或者权限设置有误,导致 FastGPT 无法建立连接。 - 现象:工作流中文本内容提取组件无法从引用中获取数据。原因:知识库引用与文本内容提取组件的连接逻辑配置不当,组件期望的输入格式与实际接收到的引用数据格式不符。
怎么确认配好了
- 上传一份典型的药物经济学报告,检查其结构化解析结果,核对关键字段(如 ICER、QALY、成本)是否准确提取且格式正确。
- 执行一个包含复杂查询的工作流,验证其是否能根据报告内容提供准确且专业的回答,特别是涉及模型参数和敏感性分析的问答。
- 检查系统日志,确保没有持续性的数据库连接错误或文件解析超时警告。
- 通过 FastGPT 界面,确认知识库中的分段数量和内容符合预期,没有出现大量空分段或无效分段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。