Google 的 Gemini 4 Pro 洩漏至 Arena,擊敗 Astra 與 Fable 5.1,並在四項基準測試中領先
根據開發者在 AI Arena 進行的測試,Google 尚未發布的 Gemini 4 Pro 模型疑似以「gemini-3.8-flash」為代號洩露,其在多項基準測試中的效能明顯優於 OpenAI 的 Astra 和 Anthropic 的 Fable 5.1。 該模型在 DeepSWE v1.1(軟體工程)中取得 88% 的分數,領先 Astra 近 2 個百分點;在 GDPval-AA v2(真實世界知識工作)中取得 2,064 的 Elo 評分,並在 Terminal-bench 2.1(終端機程式設計)中取得 95.3% 的分數。在 OSWorld-2.0(電腦操作)中,該模型達到 86.8%,優於另外兩個競爭模型。洩露的定價顯示,每 100 萬個輸入代幣可能收費 2.25 美元,每 100 萬個輸出代幣收費 11.25 美元,價格可能低於其他替代方案。 測試該模型的開發者回報稱,該模型具備先進的 UI 設計、3D 模型生成、SVG 建立和互動式遊戲開發能力,能在幾分鐘內完成 Minecraft 風格遊戲、3D 直升機等專案。據報導,該模型可能支援最多 1,000 萬個輸入