DeepSeek-R1, à l'occasion du premier anniversaire de sa sortie, dévoile le nouveau modèle « MODEL1 »

robot
Création du résumé en cours

Le 21 janvier, selon Quantum Bit, à l’occasion du premier anniversaire de la sortie de DeepSeek-R1, un nouveau modèle nommé « MODEL1 » a été dévoilé. DeepSeek a mis à jour le code FlashMLA sur GitHub, mentionnant MODEL1 à 28 reprises dans 114 fichiers, apparaissant comme un modèle distinct de V32. Il est connu que V32 est DeepSeek-V3.2, et il est très probable que MODEL1 soit une nouvelle architecture. Les différences spécifiques dans le code se manifestent dans la disposition du cache KV, le traitement de la sparsité et le décodage FP8, avec plusieurs variations dans l’optimisation de la mémoire.

Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
0/400
Aucun commentaire
  • Épingler

Trader les cryptos partout et à tout moment
qrCode
Scan pour télécharger Gate app
Communauté
Français (Afrique)
  • بالعربية
  • Português (Brasil)
  • 简体中文
  • English
  • Español
  • Français (Afrique)
  • Bahasa Indonesia
  • 日本語
  • Português (Portugal)
  • Русский
  • 繁體中文
  • Українська
  • Tiếng Việt