2.8 萬億個參數。100 萬個 token 的上下文。原生多模態。


Kimi Delta Attention 在 100 萬 token 的上下文中可提供最高 6.3 倍更快的解碼速度,並在此過程中將 KV-cache 記憶體最高降低 75%。
Attention Residuals 在新增不到 2% 的運算成本下,訓練效率約提升 25%。
為長期視野的代理式程式碼編寫與自我演化工作流程而打造,可在最少的人為監督下維持長時間的工程作業。
查看原文
post-image
post-image
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆