GPT-5.6 在 React 編碼基準測試中以 43.1% 奪冠,但與競爭對手的效能差距極小
根據 Beating,Million 發布了 ReactBench v1,這是一個用來測試 AI 程式碼代理(coding agents)的基準,涵蓋 51 個真實的 React 開發任務。GPT-5.6 Sol 的得分為 43.1%,居於領先;Fable 5 緊隨其後,為 41.2%。Million 指出,兩者差距微乎其微,不足以證明 Sol 具備明顯優勢。即便在得分上領先,表現最佳的模型也僅完成不到一半的任務。在 4,455 項測試中,所有模型共引入 1,194 個 React 問題,其中 77.5% 被歸類為錯誤或安全性問題。