微化知識
新聞資訊
- 動態管式反應器小試中試產業化設備持液量是多少?持液量具體數據
- 微通道反應器小試中試產業化設備持液量分別是多少?
- 連續流工藝合成聚酯樹脂,連續流技術合成聚酯樹脂
- 微通道反應器怎么做到本質安全?微通道反應器安全優勢
- 動態管式反應器有哪些優勢?動態管式反應器優勢
微化知識
- 《自然化學工程》:Fast-Cat——用于催化劑加速開發的自驅動實驗室
- 《當前化學工程觀點》綜述:AI 在反應預測與化學合成中的三大流派
- “拆解”與“組裝”:連續流光催化如何高效合成藥物關鍵骨架?
- 塑料也能“流動”起來?連續細乳液聚合實現百克級穩定生產
- 微波“快閃”+連續流動:給分子“貼標簽”也能如此高效環保
聯系我們
手機:19314072625
電話:400-172-8090
郵箱:kxwlhg@163.com
地址:安徽省合肥市高新區永和路597號綠城科技園E棟6樓
設備解析
利用高通量實驗構建藥物相關的Pd催化C-N偶聯反應性模型
- 作者:楊海軍
- 發布時間:2026-04-17
- 點擊:635
鈀催化C-N偶聯反應是藥物化學中應用最廣泛的轉化之一,但構建能夠準確預測復雜藥物分子偶聯產率的機器學習模型仍是一大挑戰。近日,MIT的Jensen課題組、Buchwald課題組與默克公司合作,在《J. Am. Chem. Soc.》上發表研究,通過高通量實驗(HTE)生成包含4204個獨特產物的結構多樣性數據集,并系統評估了模型在不同數據拆分策略下的插值與外推性能。本文將帶您解讀這一面向藥物化學實際需求的建模新范式。
研究背景:為什么需要新的C-N偶聯反應性模型?
將高通量實驗與數據科學相結合,為加速合成化學創新提供了巨大機遇,但目前報道的HTE數據集大多結構多樣性有限。對于藥物化學中常用的鈀催化C-N偶聯反應,現有建模工作主要依賴兩類數據:歷史文獻/專利數據(Strategy I)或HTE生成的小規模數據集(Strategy II)。歷史數據雖大但質量參差不齊,且偏向成功反應,導致模型預測性能較差(R2 ~ 0.2);而以往HTE數據集要么產物結構單一(如僅5種產物),要么與藥物相關化學空間重疊有限。因此,亟需一個結構多樣、質量均一、包含足夠多失敗案例的大規模HTE數據集,以構建能真正應用于藥物篩選的預測模型。

研究方法:如何構建大規模、結構多樣的HTE數據集?
為實現這一目標,研究團隊首先需要開發適用于納摩爾級自動化篩選的C-N偶聯反應條件。他們基于Merck內部化合物庫(MBBCC,含>5000種芳基溴和>3000種仲胺),理論上可組合出約1500萬種產物。通過對22種Pd預催化劑、47種堿的系統篩選,他們意外發現LiOTMS作為堿時,與CPhos Pd G4或(Bu)PhCPhos Pd G4組合,能顯著提升對18種復雜“Informer”芳基鹵化物的偶聯效率,成功率和平均產率較傳統方法提高2-3倍。最終選定CPhos Pd G4 + LiOTMS作為單一標準條件進行后續大規模實驗。
在底物選擇上,他們從MBBCC中隨機挑選了347種胺和342種芳基溴,這些分子均勻覆蓋了化學空間,并與已上市藥物的結構特征高度重疊。數據集構建分兩部分進行:Part I將4種芳基溴(含3種Informer溴化物)與348種胺進行偶聯,得到1392個反應;Part II將357種芳基溴(含15種Informer鹵化物)與8種代表性胺進行偶聯,得到2844個反應。合并去重后共獲得4204個獨特產物的反應結果,其中約35%產率≥20%(LCAP),其余為低產率或失敗反應,保證了數據分布的均衡性。
為確保數據質量,團隊對底物純度和實驗重復性進行了系統評估。通過從外部供應商購買部分胺進行重復實驗,確認90%的反應結果一致;通過Suzuki-Miyaura偶聯反應驗證了80%以上芳基溴的結構正確性。更重要的是,他們對重復實驗的回歸分析顯示R2僅為0.35,但以20%產率為閾值的分類一致性卻很高(假陽性1例,假陰性4例),表明分類模型更能容忍實驗噪聲,因此后續建模以分類任務為主。

模型構建與評估:多種拆分策略全面檢驗預測能力
基于上述數據集,團隊構建了隨機森林(RF)、消息傳遞神經網絡(MPNN)等多種分類模型,以20% LCAP為閾值將反應劃分為“成功”與“失敗”。為系統評估模型的插值和外推能力,他們設計了五種數據拆分策略:隨機拆分(評估插值)、胺類完全未見(Amine OOS)、芳基鹵完全未見(ArX OOS)、兩者均未見(Both OOS)以及降維拆分(DRS,即反應物已見但組合未見,用于評估插值到全因子空間的能力)。模型性能以準確率、top 10%預測精度(precision@10%)、top 10%正負類平均精度(accuracy@10%)和PR-AUC為指標。
結果顯示,所有拆分策略下模型的accuracy@10%均超過80%,表明模型置信度可有效識別高產率或低產率反應。其中,隨機拆分和DRS的表現優于OOS拆分,符合預期(插值易于外推);而Both OOS拆分仍能達到68%以上的準確率和80%以上的accuracy@10%,證明模型確實學到了通用的反應性規律,即使面對全新底物也能給出可靠預測。值得注意的是,模型對高產率反應的預測精度略低于對低產率反應的預測,這可能與數據集中高產率反應占比較低(35%)有關,但precision@10%仍超過70%,是隨機篩選(35%命中率)的兩倍。

實驗驗證:96孔板驗證庫證實模型實用性
為驗證模型在實際藥物篩選場景中的表現,團隊針對每個OOS拆分和DRS拆分分別設計了96反應的驗證庫。從MBBCC中隨機選取符合拆分條件的胺和芳基溴,確保與訓練集分子的Tanimoto相似度<0.7,并保證其中50%反應被模型預測為高產率(置信度>0.8-0.9),50%預測為低產率。實驗結果顯示,所有驗證庫的整體準確率均超過80%,且假陰性(FN)極少,意味著模型幾乎不會漏掉真正高產率的反應,這對于避免浪費珍貴底物至關重要。假陽性(FP)相對較多,主要源于模型對高產率反應的預測不夠自信,但整體仍顯著優于隨機篩選。

結論與展望
本研究通過HTE生成了迄今為止結構最多樣、與藥物化學最相關的Pd催化C-N偶聯反應數據集(4204個獨特產物),并基于此構建了高性能分類模型。模型在胺/芳基鹵完全未見的外推場景下仍保持高預測精度,證明其學習了普適的反應性規律;在降維拆分中的優異表現則意味著僅需全因子空間的一小部分數據即可實現對整個空間的可靠預測。該工作為藥物發現中高效篩選C-N偶聯反應提供了有力工具,可顯著提升命中率、節約資源。未來,該工作流程可擴展至其他反應類型,并探索更優的主動學習數據集設計策略。
- 上一篇:動態管式反應器磁力耦合密封與雙端面機械密封的區別
- 下一篇:沒有了!

客服QQ