Google malum TurboQuant adını verdiği bir sıkıştırma teknolojisi tanıttı. Büyük dil modellerinin KV cache belleğini bazı senaryolarda 6 kata kadar sıkıştırabiliyor.
KV cache denen şey, dil modellerinin uzun bağlam pencerelerinde konuşma geçmişini tuttuğu bellek alanı. Bağlam penceresi büyüdükçe alan da büyüyor, ciddi bellek tüketiyor.
İlk bakışta Micron için kötü haber gibi duyor. Nitekim hisselere negatif tesir etti.
Fakat Bloomberg Intelligence analistleri diyor ki model ağırlıkları hala GPU belleğinde durmak zorunda, sıkıştırma onlara dokunmuyor. Dolayısıyla yüksek bant genişlikli bellek, yani HBM talebi devam.
Devamını okumak için lütfen giriş yapın
Hesabınız yoksa lütfen abone olun.
Hemen Abone Ol