広場
最新
注目
ニュース
プロフィール
ポスト
DanielRomero
2026-07-27 08:30:11
フォロー
$AMD
は、ROCmを使用してMI300XおよびMI325X GPU上で全面的に学習した、最先端の完全にオープンなモデルをリリースしました
Instella-MoEは160億(16-billion)パラメータの混合専門家(mixture-of-experts)モデルで、トークンごとに有効化するのは28億(2.8 billion)パラメータのみです。これにより推論コストを下げつつ、同程度またはそれ以上の有効パラメータ数を持つ密(dense)モデルやMoEモデルと競争力を維持します
64Kのコンテキストウィンドウに対応しており、事前学習から強化学習まで、6つの段階を経て訓練されました
AMDはさらに2つの新しい効率化技術も導入しました:
- 低価値な注意(attention)出力をフィルタするGated Multi-head Latent Attention
- 通信と計算を重ねるFarSkip-Collectiveで、事前学習速度を12.7%向上させ、初回トークンまでの時間(time-to-first-token)を最大39.2%削減します
AMD
-8.13%
原文表示
このページには第三者のコンテンツが含まれている場合があり、情報提供のみを目的としております(表明・保証をするものではありません)。Gateによる見解の支持や、金融・専門的な助言とみなされるべきものではありません。詳細については
免責事項
をご覧ください。
6 いいね
報酬
6
2
1
共有
コメント
コメントを追加
コメントを追加
コメント
GateUser-17ba047d
· 07-27 10:00
ブロックチェーン技術はどのように機能しますか
原文表示
返信
0
Mehedi667
· 07-27 09:54
😉🔥
返信
0
人気の話題
もっと見る
#
USD1StakingEarnUpTo8%APR
680.49K 人気度
#
GateCardEarn8%CashbackonGlobalSpending
14.29K 人気度
#
IsraelStrikesIranBTCPlunges
78.99K 人気度
#
CXMTPreIPOContractIgnitesCommunity
160.13K 人気度
#
MinnesotaPredictionMarketBanBlocked
2.3M 人気度
ピン留め
サイトマップ
$AMD は、ROCmを使用してMI300XおよびMI325X GPU上で全面的に学習した、最先端の完全にオープンなモデルをリリースしました
Instella-MoEは160億(16-billion)パラメータの混合専門家(mixture-of-experts)モデルで、トークンごとに有効化するのは28億(2.8 billion)パラメータのみです。これにより推論コストを下げつつ、同程度またはそれ以上の有効パラメータ数を持つ密(dense)モデルやMoEモデルと競争力を維持します
64Kのコンテキストウィンドウに対応しており、事前学習から強化学習まで、6つの段階を経て訓練されました
AMDはさらに2つの新しい効率化技術も導入しました:
- 低価値な注意(attention)出力をフィルタするGated Multi-head Latent Attention
- 通信と計算を重ねるFarSkip-Collectiveで、事前学習速度を12.7%向上させ、初回トークンまでの時間(time-to-first-token)を最大39.2%削減します