
大模型已經(jīng)能夠回答復(fù)雜的科學(xué)問題,也能識(shí)別和描述圖像內(nèi)容。但在真實(shí)科研場(chǎng)景中,看見圖像并不等于理解實(shí)驗(yàn)。面對(duì)一張真實(shí)實(shí)驗(yàn)圖像或分析結(jié)果,模型能否抓住其中的關(guān)鍵信息,判斷當(dāng)前實(shí)驗(yàn)狀態(tài),并給出合理的解釋和下一步建議? 為回答這一問題,晶泰科技聯(lián)合上海人工智能實(shí)驗(yàn)室、中國(guó)科學(xué)院上海硅酸鹽研究所、上海交通大學(xué)、嘉興大學(xué)等機(jī)構(gòu),聯(lián)合創(chuàng)建了 LabOPBench——一個(gè)面向真實(shí)化學(xué)與材料實(shí)驗(yàn)場(chǎng)景的多模態(tài)評(píng)測(cè)集。它包含 756 道由實(shí)驗(yàn)人員設(shè)計(jì)并獨(dú)立審核的題目,重點(diǎn)考察模型能否將真實(shí)實(shí)驗(yàn)中的視覺證據(jù)轉(zhuǎn)化為可靠的實(shí)驗(yàn)判斷。 我們對(duì) 7 個(gè)主流多模態(tài)模型進(jìn)行了系統(tǒng)測(cè)試。結(jié)果顯示,沒有一個(gè)模型的總體得分超過 50%,最高分僅為 45.8%。這意味著,當(dāng)前模型雖然已經(jīng)具備一定的科學(xué)知識(shí)和圖像理解能力,但距離穩(wěn)定、可靠地理解真實(shí)實(shí)驗(yàn),仍有明顯差距。

真實(shí)實(shí)驗(yàn)場(chǎng)景中,
模型究竟需要回答什么?
在真實(shí)科研中,許多關(guān)鍵問題并不存在可以直接檢索或套用的標(biāo)準(zhǔn)答案。研究人員需要結(jié)合實(shí)驗(yàn)現(xiàn)象、儀器輸出和樣品狀態(tài),識(shí)別與決策相關(guān)的證據(jù),并進(jìn)一步判斷:當(dāng)前實(shí)驗(yàn)是否處于正常狀態(tài),異常可能由什么原因引起,以及接下來(lái)應(yīng)該采取什么操作。

LabOPBench 共覆蓋五類實(shí)驗(yàn)任務(wù);
圖 a 展示五個(gè)大類及其題目占比,
圖 b–e 呈現(xiàn)實(shí)驗(yàn)準(zhǔn)備、實(shí)驗(yàn)后處理、
實(shí)驗(yàn)監(jiān)測(cè)和實(shí)驗(yàn)表征四個(gè)大類下的細(xì)分類別分布
LabOPBench 正是圍繞這類 “從實(shí)驗(yàn)觀察到科學(xué)決策” 的問題構(gòu)建。評(píng)測(cè)共包含 756 道題目,其中 664 道來(lái)自有機(jī)合成實(shí)驗(yàn),92 道來(lái)自材料科學(xué)實(shí)驗(yàn)。題目均基于真實(shí)實(shí)驗(yàn)圖像和科學(xué)分析結(jié)果,覆蓋兩個(gè)領(lǐng)域中的典型實(shí)驗(yàn)判斷場(chǎng)景。這些題目關(guān)注的并不是模型 “記住了多少科學(xué)知識(shí)”,而是它能否真正讀懂實(shí)驗(yàn)現(xiàn)象:從圖像和分析結(jié)果中提取關(guān)鍵證據(jù),并根據(jù)具體問題判斷實(shí)驗(yàn)狀態(tài)、分析可能原因,或給出合理的后續(xù)操作。

不是識(shí)圖題,而是實(shí)驗(yàn)分析題
LabOPBench 并不只考察模型對(duì)實(shí)驗(yàn)器材或表面現(xiàn)象的識(shí)別能力。每道題均對(duì)應(yīng)一個(gè)具體且可獨(dú)立判斷的實(shí)驗(yàn)情境,模型需要結(jié)合圖像證據(jù)與必要的背景信息,對(duì)當(dāng)前實(shí)驗(yàn)狀態(tài)進(jìn)行判斷,分析潛在原因或風(fēng)險(xiǎn),并提出合理的后續(xù)操作建議。
LabOPBench 的核心評(píng)測(cè)目標(biāo),在于考察模型能否完成從實(shí)驗(yàn)現(xiàn)象觀察、狀態(tài)與原因分析,到后續(xù)操作決策的完整推理過程。模型不僅需要判斷實(shí)驗(yàn)中發(fā)生了什么,還需要說明其可能原因,并據(jù)此給出相互一致的處理方案。
所有題目均采用開放式文本作答,而非預(yù)設(shè)選項(xiàng)。每道題均配有由專家制定的 0—3 分評(píng)分標(biāo)準(zhǔn)。評(píng)分不僅考察最終結(jié)論是否正確,還關(guān)注回答是否識(shí)別了關(guān)鍵實(shí)驗(yàn)依據(jù),以及狀態(tài)判斷、原因分析與操作建議之間是否保持一致。

總榜單:最強(qiáng)模型仍未超過50分
我們?cè)谕暾?756 道題目上評(píng)測(cè)了 7 個(gè)主流多模態(tài)模型。Claude Opus 4.7 以45.8% 的總體得分位列第一,GPT-5.5 以 43.6% 排名第二,Gemini 3.1 Pro 以 41.9% 排名第三。所有模型的總體得分分布在 36.7% 至 45.8% 之間,沒有一個(gè)模型超過 50%。

進(jìn)一步來(lái)看,模型在不同實(shí)驗(yàn)場(chǎng)景中的表現(xiàn)差異明顯。其中,反應(yīng)后處理的整體表現(xiàn)最低,七個(gè)模型的平均得分為 36.3%,且該類別在全部七個(gè)模型中均取得最低得分。
在有機(jī)化學(xué)實(shí)驗(yàn)中,反應(yīng)后處理是連接反應(yīng)過程與最終樣品獲得的核心環(huán)節(jié),涵蓋分離、純化和過程狀態(tài)判斷等一系列關(guān)鍵操作。實(shí)驗(yàn)?zāi)芊褡罱K獲得合格樣品,往往取決于這一階段能否根據(jù)實(shí)際現(xiàn)象及時(shí)作出正確判斷。模型在這一核心環(huán)節(jié)上的表現(xiàn)相對(duì)較弱,表明其在真實(shí)實(shí)驗(yàn)中的操作判斷能力仍有較大提升空間。

最強(qiáng)模型仍未達(dá)到博士生平均水平
為了更直觀地了解模型目前處于什么水平,我們讓 7 個(gè)模型、5 名本科生和 5 名博士生完成同一組 100 道有機(jī)化學(xué)實(shí)驗(yàn)題。所有人類參與者均基于與模型相同的圖像和背景信息獨(dú)立作答,回答也采用相同的標(biāo)準(zhǔn)進(jìn)行評(píng)分。

結(jié)果顯示,本科生和博士生的平均得分分別為 31.0% 和 45.9%。表現(xiàn)較好的 Claude Opus 4.7 和 GPT-5.5 分別獲得 43.7% 和 43.5%,超過本科生平均水平,但仍低于博士生平均分。
這一結(jié)果表明,頂尖多模態(tài)模型已經(jīng)超過本科生參與者的平均水平,展現(xiàn)出一定的實(shí)驗(yàn)判斷能力。但即使是表現(xiàn)最好的模型,也未達(dá)到博士生參與者的平均分。當(dāng)前模型在真實(shí)實(shí)驗(yàn)情境中的表現(xiàn)仍有進(jìn)一步提升空間。

看見不等于看懂:
模型為何仍會(huì)誤判真實(shí)實(shí)驗(yàn)?
模型在評(píng)測(cè)中的得分,究竟來(lái)自對(duì)實(shí)驗(yàn)圖像的真實(shí)理解,還是主要依賴問題文字和已有知識(shí)進(jìn)行推斷?為了驗(yàn)證這一點(diǎn),在同一組 100 道題目上,我們進(jìn)一步進(jìn)行了圖像錯(cuò)配實(shí)驗(yàn),以檢驗(yàn)?zāi)P偷幕卮鹁烤挂蕾囌鎸?shí)圖像,還是主要來(lái)自問題文字和已有知識(shí)。實(shí)驗(yàn)將原始圖片替換為同一細(xì)分類別中、但與當(dāng)前問題不匹配的圖片,其余設(shè)置保持不變。

結(jié)果顯示,7 個(gè)模型的得分均明顯下降,跨模型平均分由 39.0% 降至 20.1%,平均下降 18.9 個(gè)百分點(diǎn)。其中,GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7 的降幅均超過 20 個(gè)百分點(diǎn)。
這說明,實(shí)驗(yàn)圖像并不是可有可無(wú)的附加信息,模型的回答確實(shí)依賴圖像與問題之間的對(duì)應(yīng)關(guān)系。但與此同時(shí),對(duì)圖像敏感并不意味著模型已經(jīng)正確理解了圖像中的實(shí)驗(yàn)信息。模型可能利用了部分視覺線索,卻仍未識(shí)別真正決定答案的關(guān)鍵證據(jù)。
為進(jìn)一步識(shí)別高性能模型的主要失分來(lái)源,我們對(duì)總體表現(xiàn)最好的 Claude Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro 進(jìn)行了專家錯(cuò)誤分析。兩名專家逐一審查三個(gè)模型的非滿分回答,并將能夠明確歸因的問題歸納為六類錯(cuò)誤。

結(jié)果顯示,證據(jù)提取失?。?0.0%)和原因—行動(dòng)不匹配(35.8%)合計(jì)占 75.8%,其余四類錯(cuò)誤占比均低于 8%。這表明,高性能模型的主要瓶頸不在于孤立的化學(xué)知識(shí)錯(cuò)誤,而在于證據(jù)驅(qū)動(dòng)推理鏈條仍不穩(wěn)定:模型難以準(zhǔn)確識(shí)別決策相關(guān)的關(guān)鍵實(shí)驗(yàn)信息,并將原因判斷轉(zhuǎn)化為一致、可執(zhí)行的操作建議。

從看見實(shí)驗(yàn),到作出可靠判斷
LabOPBench 的結(jié)果表明,當(dāng)前多模態(tài)模型已經(jīng)能夠利用真實(shí)實(shí)驗(yàn)圖像和分析結(jié)果,并在部分任務(wù)中作出合理判斷。但從總體表現(xiàn)、人類對(duì)比、圖像錯(cuò)配和錯(cuò)誤分析來(lái)看,模型仍難以穩(wěn)定識(shí)別與當(dāng)前實(shí)驗(yàn)決策最相關(guān)的證據(jù),并據(jù)此形成一致的原因解釋和行動(dòng)建議。
模型能力的進(jìn)一步提升不能只依賴擴(kuò)大規(guī)?;蜓a(bǔ)充科學(xué)知識(shí),更需要強(qiáng)化基于真實(shí)證據(jù)進(jìn)行狀態(tài)判斷、原因分析和行動(dòng)選擇的能力。相應(yīng)的訓(xùn)練數(shù)據(jù)也應(yīng)覆蓋失敗案例、干預(yù)結(jié)果和驗(yàn)證過程,而不僅是成功的實(shí)驗(yàn)流程。
從看見實(shí)驗(yàn),到理解證據(jù),再到作出可靠判斷,仍是大模型走向可信實(shí)驗(yàn)助手需要跨越的重要一步。
• 項(xiàng)目資源
LabOPBench 的項(xiàng)目介紹、部分?jǐn)?shù)據(jù)與評(píng)測(cè)資源已公開,后續(xù)內(nèi)容將持續(xù)更新。
• 評(píng)測(cè)倉(cāng)庫(kù)
https://github.com/johnnylee00/LabOPBench
• 數(shù)據(jù)集鏈接
https://huggingface.co/datasets/JOHNNYlee1/LabOPBench
聯(lián)系人:晶泰科技
郵箱:bd@xtalpi.com
電話:021-68780786
地址:深圳市福田區(qū)福保街道福保社區(qū)紅柳道2號(hào)國(guó)際生物醫(yī)藥產(chǎn)業(yè)園二期1層
晶泰科技服務(wù)號(hào)
晶泰智造公眾號(hào)
©2026 深圳晶泰科技有限公司 版權(quán)所有 備案號(hào):粵ICP備17120953號(hào) 技術(shù)支持:化工儀器網(wǎng) Sitemap.xml 總訪問量:120621 管理登陸