这个品类的数据长什么样
光学光电子行业的财报数据主要来自证券监管机构官方披露平台、中国光学光电子行业协会公开报告,更新节奏以季度、半年度、年度定期披露为主,临时公告如产能调整、新品发布同步更新。文档包含结构化财务报表与非结构化经营说明,字段涵盖营业收入、出货量、良品率、研发投入占比等,其中出货量单位多为万片、万颗,良品率为百分比数值,部分面板相关财报还包含显示尺寸、功率参数等细分字段,文件格式多为PDF公告与XBRL结构化文件。
这些特征在「引用来源与溯源」这一环带来什么约束
光学光电子财报的细分字段多、专业性强,要求溯源需精准匹配字段名称与对应披露内容,避免与其他行业财报混淆。结构化XBRL文件的存在要求溯源需关联元素ID与公告编号,不应仅依赖文本片段匹配。定期与临时同步的更新节奏,要求溯源系统需保留每条数据的披露时间戳,确保引用内容的时效性。非结构化经营说明中的产能规划、技术参数描述,需精准定位段落来源,避免跨文档的字段混淆。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
recallTopK | 10-15 | 光学光电子财报包含细分行业字段(如良率、出货量),需要足够召回量覆盖精准匹配的文档 |
similarityThreshold | 0.72-0.78 | 财报同类字段语义相似度较高,阈值过低会引入非相关财报公告 |
chunkSize | 800-1200字符 | 适配光学光电子财报的结构化报表段落与非结构化经营说明的长度,避免拆分破坏字段完整性 |
enableXbrlParse | 开启 | 多数光学光电子财报以XBRL格式披露,可精准提取标准化字段并关联溯源ID |
sourceRetainCount | 3-5 | 财报分析的引用需聚焦核心依据,过多溯源信息会干扰分析逻辑 |
maxContextWindow | 12000-15000字符 | 支撑光学光电子财报多字段对比的上下文需求,避免截断关键关联数据 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:模型上下文展示条数与实际召回条数不一致,如页面显示上下文仅30条,但实际发送的召回条数远超配置值。原因:未正确配置
maxContextWindow参数,导致系统自动截断超出窗口的召回内容,仅展示截断后的部分。 - 现象:设置了
sourceRetainCount为1500,但知识库中超过1500字符的文档块仍被引用。原因:混淆了sourceRetainCount与chunkSize的配置逻辑,sourceRetainCount为保留的溯源条目数,并不等同于单块文档的长度限制。 - 现象:在生成的财报分析正文内无法调用已提取的财报字段变量。原因:未正确配置变量映射的触发规则,或未在系统提示词中声明变量调用的格式要求。
怎么确认配好了
- 上传一份光学光电子的公开财报公告,查看知识库解析后的字段详情,确认已提取品类专属的细分字段。
- 发起一次财报分析查询,查看返回结果的溯源模块,确认每条引用都附带官方披露的公告编号与时间戳。
- 调整召回类配置参数至目标值,发起查询后核对召回的文档条数与配置值匹配。
- 导入长度超出预设单块限制的财报文档,触发查询后确认系统正常处理该类文档的引用请求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。