微化知識
新聞資訊
- 動態(tài)管式反應器小試中試產(chǎn)業(yè)化設備持液量是多少?持液量具體數(shù)據(jù)
- 微通道反應器小試中試產(chǎn)業(yè)化設備持液量分別是多少?
- 連續(xù)流工藝合成聚酯樹脂,連續(xù)流技術合成聚酯樹脂
- 微通道反應器怎么做到本質(zhì)安全?微通道反應器安全優(yōu)勢
- 動態(tài)管式反應器有哪些優(yōu)勢?動態(tài)管式反應器優(yōu)勢
微化知識
- 《Pharmaceutical Fronts》綜述:人工智能在連續(xù)流化學過程分析與優(yōu)化中的應用
- 《自然化學工程》:Fast-Cat——用于催化劑加速開發(fā)的自驅(qū)動實驗室
- 《當前化學工程觀點》綜述:AI 在反應預測與化學合成中的三大流派
- “拆解”與“組裝”:連續(xù)流光催化如何高效合成藥物關鍵骨架?
- 塑料也能“流動”起來?連續(xù)細乳液聚合實現(xiàn)百克級穩(wěn)定生產(chǎn)
聯(lián)系我們
手機:19314072625
電話:400-172-8090
郵箱:kxwlhg@163.com
地址:安徽省合肥市高新區(qū)永和路597號綠城科技園E棟6樓
科學前沿
主動學習賦能:如何用400個實驗預測2.2萬個化學反應?
- 作者:楊海軍
- 發(fā)布時間:2026-04-10
- 點擊:617
在藥物研發(fā)中,C(sp2)–C(sp3) 偶聯(lián)反應是構建三維復雜分子的關鍵工具,但其底物空間巨大,傳統(tǒng)高通量實驗(HTE)難以全面覆蓋。近日,UCLA的Doyle課題組與諾華團隊在《J. Am. Chem. Soc.》上發(fā)表研究,提出了一種主動學習(Active Learning)策略,僅用不到400個數(shù)據(jù)點就構建了可推廣的Ni/光氧化還原催化偶聯(lián)產(chǎn)率預測模型。本文將帶您解讀這一“數(shù)據(jù)高效”的建模新范式。
研究背景:為什么需要主動學習?
機器學習在有機合成中的應用日益廣泛,但產(chǎn)率預測仍面臨兩大挑戰(zhàn):底物空間巨大,芳基溴與烷基溴的組合可產(chǎn)生數(shù)萬種產(chǎn)物;數(shù)據(jù)質(zhì)量不一,文獻數(shù)據(jù)存在混雜變量,而企業(yè)電子實驗記錄本(ELN)數(shù)據(jù)也難以統(tǒng)一。傳統(tǒng)方法通常依賴大規(guī)模隨機采樣,但耗時耗力。本研究提出:用主動學習動態(tài)探索底物空間,以最少實驗構建最具信息量的模型。

研究方法:如何用主動學習構建模型?
研究團隊首先定義了初始虛擬空間,由8種芳基溴與2776種烷基溴組合成22,208種產(chǎn)物,并另外設計了包含4種新芳基溴的擴展空間用于驗證模型的擴展能力。所有底物均選自Sigma-Aldrich以確保可獲得性。在特征工程方面,他們利用AutoQchem和Turbomole軟件計算了烷基溴及其自由基中間體的DFT性質(zhì),包括HOMO/LUMO能量、電荷分布、NMR屏蔽等,同時結(jié)合差分反應指紋(Difference Morgan Fingerprints)來捕捉反應前后結(jié)構的全局變化。主動學習流程采用基于隨機森林模型的不確定性查詢,每輪選擇12個烷基溴與8種芳基溴反應(共96個實驗),并通過Kriging Believer策略避免批次內(nèi)選擇過于相似的分子,從而最大化每輪實驗的信息增益。

實驗結(jié)果:主動學習 vs 隨機采樣
在模型性能對比中,前兩輪主動學習與隨機采樣差異不大,但從第3、4輪起,主動學習模型的均方根誤差顯著降低,決定系數(shù)R2明顯提高;在未參與訓練的擴展核心集(新芳基溴)上,主動學習模型的表現(xiàn)持續(xù)提升,而隨機采樣模型幾乎無效。令人驚訝的是,僅用約250–350個產(chǎn)物(覆蓋1–2%虛擬空間)就構建了可用的預測模型,而向新核心擴展時,只需額外測試約20個烷基溴(80個反應)即可顯著提升預測能力。此外,主動學習選擇的烷基溴實際產(chǎn)率普遍更高(>10%產(chǎn)率的比例顯著高于隨機采樣),原因是模型傾向于選擇預測產(chǎn)率較高但不確定性也高的分子,而非低產(chǎn)率低不確定性的分子,這在實際藥物篩選場景中更具實用價值。


應用驗證:篩選高潛力反應
為了模擬藥物篩選中的實際應用,研究團隊進一步測試了模型在新核心(E1–E4)上篩選高產(chǎn)率烷基溴的能力。他們讓主動學習模型和隨機采樣模型分別預測,并選取兩者預測差異最大的烷基溴進行實驗驗證。結(jié)果顯示,主動學習模型所選的8個烷基溴中,80%的反應產(chǎn)率超過10%,而隨機模型所選的反應僅有36%達到該閾值。這表明主動學習模型可顯著減少無效實驗,大幅提升高通量篩選的效率。

特征重要性:DFT特征為何關鍵?
模型特征重要性分析顯示,烷基自由基的LUMO能量、Br原子電荷等DFT特征占據(jù)主導地位,這些特征將烷基溴分為三類:烯丙基/芐基型、羰基α位型和脂肪族型,對應于不同的自由基穩(wěn)定性與反應活性。有趣的是,單獨使用DFT特征即可取得不錯的效果,而僅用分子指紋則表現(xiàn)較差,說明電子效應對該類偶聯(lián)反應的產(chǎn)率預測至關重要。

結(jié)論與展望
本研究證明,主動學習結(jié)合DFT特征可用極少量實驗構建可推廣的產(chǎn)率預測模型,并能有效擴展至新底物空間,適用于高通量實驗的預篩選。未來該策略有望推廣至更多反應類型,并用于探索“反應暗空間”中的新方法開發(fā)。研究團隊認為,反應空間的系統(tǒng)映射需要分析化學、高通量實驗、數(shù)據(jù)采樣策略和機器學習的持續(xù)創(chuàng)新,而學術界與工業(yè)界的緊密合作將是實現(xiàn)這一目標的關鍵。

客服QQ