Yapay zeka dünyası, büyük dil modellerinin (LLM) sınırlarını zorlamaya devam ederken, hem maliyetleri düşüren hem de performansı artıran yeni mimariler ön plana çıkıyor. Bu mimarilerin en dikkat çekicisi ve günümüzün en güçlü yapay zeka modellerinin arkasındaki gizli kahraman olan Mixture of Experts (MoE) yaklaşımıdır. Geleneksel yoğun (dense) modellerin aksine, MoE mimarisi her görev için tüm sinir ağını çalıştırmak yerine sadece ilgili uzman ağları devreye sokarak inanılmaz bir verimlilik sağlar. Bu yazımızda, yapay zekanın geleceğini şekillendiren bu yenilikçi mimariyi tüm detaylarıyla ele alacağız.
Mixture of Experts (MoE) Nedir?
Mixture of Experts (MoE), bir yapay zeka modelinin kapasitesini (parametre sayısını) artırırken, her bir işlem için gereken hesaplama maliyetini (FLOPs) sabit tutmayı veya çok az artırmayı hedefleyen bir makine öğrenimi mimarisidir. Geleneksel "yoğun" (dense) modellerde, girdi olarak verilen her kelime (token) için modeldeki tüm parametreler çalıştırılır. Örneğin, 175 milyar parametreli bir modelde, sorduğunuz basit bir "Merhaba" sorusu için bile 175 milyar parametrenin tamamı hesaplamaya dahil olur.MoE ise "seyrek" (sparse) bir mimaridir. Bu yapıda, modelin içinde "uzman" (expert) adı verilen çok sayıda daha küçük alt sinir ağı bulunur. Bir girdi geldiğinde, modelin tamamı değil, yalnızca o girdiyi en iyi işleyebilecek birkaç uzman ağ aktif hale getirilir. Bu sayede model teorik olarak trilyonlarca parametreye sahip olsa bile, her bir kelimeyi işlemek için sadece küçük bir kısmı (örneğin 40-50 milyar parametre) kullanılır.
MoE Mimarisinin Temel Bileşenleri
Bir MoE sisteminin verimli bir şekilde çalışabilmesi için iki temel bileşene ihtiyacı vardır: Uzmanlar ve Yönlendirici Ağ.1. Uzmanlar (Experts)
Uzmanlar, genellikle standart Transformer bloklarında bulunan İleri Beslemeli Sinir Ağlarıdır (Feed-Forward Networks - FFN). Bir MoE modelinde tek bir büyük FFN yerine, paralel olarak çalışan birden fazla (örneğin 8, 16 veya daha fazla) uzman FFN bulunur. Bu uzmanlar, eğitim sürecinde otomatik olarak belirli konularda veya dil yapılarında uzmanlaşırlar. Örneğin, bir uzman kodlama görevlerinde iyileşirken, diğeri yaratıcı yazarlık veya matematiksel işlemler konusunda uzmanlaşabilir.2. Yönlendirici Ağ (Gating Network / Router)
Yönlendirici, MoE mimarisinin beyni konumundadır. Modele giren her bir token'ın hangi uzmana veya uzmanlara gönderileceğine bu ağ karar verir. Genellikle "Top-k" yönlendirme algoritması kullanılır. Örneğin, eğerk=2 ise, yönlendirici her token için en yüksek skoru alan iki uzmanı seçer ve girdiyi sadece bu uzmanlara gönderir. Yönlendirici ağ da modelin eğitimi sırasında optimize edilir ve hangi girdilerin hangi uzmanlara gitmesi gerektiğini zamanla daha iyi öğrenir.Yoğun (Dense) ve Seyrek (Sparse) Modellerin Karşılaştırması
Yapay zeka modellerini anlamak için dense ve sparse kavramlarını netleştirmek gerekir:- Yoğun (Dense) Modeller: GPT-3 veya Llama 3 gibi modeller bu kategoridedir. Her token, modelin tüm katmanlarından ve tüm parametrelerinden geçer. Eğitim ve çıkarım maliyetleri parametre sayısıyla doğru orantılı olarak çok hızlı artar.
- Seyrek (Sparse) MoE Modelleri: Mixtral 8x7B veya GPT-4 gibi modeller bu sınıfa girer. Parametre sayısı devasa boyutta olsa da, her adımda sadece belirli parametreler etkinleştirilir. Bu durum, devasa modelleri daha düşük donanım maliyetleriyle çalıştırmayı mümkün kılar.
- GPT-4 (OpenAI): Resmi olarak tüm detayları açıklanmasa da, yapay zeka dünyasındaki yaygın kabul GPT-4'ün yaklaşık 1.8 trilyon toplam parametreye sahip, 16 uzmanlı bir MoE modeli olduğu yönündedir. Her sorguda sadece 2 uzmanın aktif olduğu ve yaklaşık 280 milyar parametrenin çalıştığı tahmin edilmektedir.
- Mixtral 8x7B (Mistral AI): Açık kaynaklı yapay zeka dünyasında MoE mimarisinin popülerleşmesini sağlayan öncü modeldir. Toplamda yaklaşık 47 milyar parametreye sahip olmasına rağmen, token başına sadece 13 milyar parametre aktif ederek Llama 2 70B modelinden daha iyi performans göstermeyi başarmıştır.
- DeepSeek-V3 (DeepSeek): Son dönemde adından sıkça söz ettiren DeepSeek, geliştirdiği yenilikçi MoE mimarisiyle çok daha küçük uzmanlar (fine-grained experts) kullanarak verimliliği en üst seviyeye taşımıştır.
Yorumlar (0)
Henüz yorum yapılmamış. İlk yorumu siz yapın!
Yorum Yazın