JPhys Photonics编辑优选:首款基于检索增强的光子专用大模型OptoChat
本篇研究来自南京大学邹宁睦课题组。本文研究团队开发了面向光学领域的检索增强大语言模型OptoChat,是首个针对光学知识理解与问答进行专门适配和优化的大语言模型。系统基于236,982篇光学文献构建专业知识库,结合问题分解、关键词与语义混合检索和重排序,在OptoQA与OptoMCQA基准上均优于多种通用大模型,并展现出更强的专业推理、幻觉抑制和答案可溯源能力。 文章介绍 OptoChat: a large language model with retrieval augmented generation for optics Xiaoqing Bao(包晓清), Hairuo Wang(王海若), Silin Chen(陈思霖), Yali Zhang(张雅丽), Wenjun Chen(陈文军), Kangjian Di(邸康健), Mengcheng Lv(吕梦成), Minghui Zhao(赵明辉), Guohao Wang(王国浩), Wenzheng Zhao(赵文政) and Ningmu Zou(邹宁睦) 通讯作者: 邹宁睦,南京大学集成电路学院 研究背景: 大语言模型在通用文本生成和知识问答中已展现出强大能力,也逐步应用于计算成像、显微自动化和光学设计等科研任务。然而,光学具有物理机制复杂、专业术语密集、知识更新快且对科学严谨性要求高等特点,通用模型在预训练阶段缺乏足够的领域知识,容易产生事实错误或“幻觉”。检索增强生成(RAG)可通过引入外部知识缓解这一问题,但直接将通用RAG用于光学仍面临查询语义难以完整解析、专业文献结构复杂以及检索结果相关性不足等挑战。为此,研究团队提出OptoChat,希望通过领域知识库、面向科学问题的查询预处理、多路径检索与重排序机制,为光学研究者和工程人员提供更准确、可验证、上下文充分的专业问答工具。 研究内容: OptoChat首先从科学期刊和权威光学资料中汇集236,982篇文献,按八个光学子领域组织,并利用YOLOv10识别文本、公式、表格和图像区域,结合PaddleOCR与YOLOv8完成内容解析,再以bge-m3生成向量并写入可增量更新的VectorDB。面对用户问题,基于Qwen2.5-32B-Instruct的Query Agent先判断是否属于光学领域,并将复杂问题分解为最多10个保持逻辑关联的子问题,同时提取关键词。检索阶段将TF-IDF/BM25关键词检索与bge-m3语义检索结合,再由bge-reranker-v2-m3对候选证据重新排序,最终将高相关上下文交给大语言模型生成答案。 研究团队构建了OptoQA(580组问答)和OptoMCQA(252道选择题)两个专业基准,并由10余名光学研究人员参与核验。OptoChat在OptoQA上取得0.3543的ROUGE-L、0.8986的自然度和0.8595的信息量评分;在OptoMCQA上准确率达96.03%,高于GPT-5.4的90.47%、GPT-4.1的88.10%和DeepSeek-V3的86.11%。消融实验显示,从RAG、问题分解、关键词分支到重排序模块的逐步加入均带来稳定提升,完整系统的选择题准确率达到0.9610。三个案例进一步表明,OptoChat能够给出更符合实验依据的机制解释,在证据不足时主动保留结论,并通过DOI/URL及图示证据增强来源透明度。该工作说明,面向学科知识特征定制RAG流程,是提升科研大模型准确性、严谨性和可信度的一条有效路径。 作者介绍 作者团队来自南京大学集成电路学院、南京南智先进光电集成技术研究院、南京信息工程大学集成电路学院及喆塔科技有限公司。包晓清、王海若、陈思霖和张雅丽为共同第一作者,邹宁睦为通讯作者。 邹宁睦 教授 南京大学 邹宁睦,国家级青年人才,南京大学集成电路学院院长助理、姑苏青年教授、博士生导师,IEEE高级会员。2011年本科毕业于南京大学,后获美国佐治亚理工学院计算机科学硕士学位和康奈尔大学光学工程博士学位。2017年至2023年,先后任美国AMD半导体公司主任工程师、美国德克萨斯州立大学电子工程系客座教授。近年来,邹宁睦博士面向集成电路先进制造与智能系统设计需求,主要从事人工智能驱动的集成电路制造与检测、计算光刻与可制造性设计优化、片上光电集成与光子智能计算,以及光电器件与半导体材料相关交叉技术研究。研究成果已在Science、Nature Electronics、Nature Communications、Advanced…