Reflection AI Beam: 501B Açık Ağırlıklı Modeli İnceledim
Beam nedir?
Beam, seyrek (sparse) bir Mixture-of-Experts (MoE) mimarisi kullanıyor. Rakamlar şöyle: toplam 501 milyar parametre, ama her ileri geçişte yalnızca 23 milyar aktif parametre çalışıyor. Bu, GLM gibi modellerde alışkın olduğumuz “dev toplam, küçük aktif” yaklaşımının tam örneği — ve pratikte çıkarım (inference) maliyetini belirleyen şey, toplam değil aktif parametre sayısı olduğu için önemli.
Diğer başlıklar: bağlam penceresi ara eğitim (midtraining) sırasında 1 milyon token’a kadar genişletilmiş; model şimdilik yalnızca metin (text-only), görüntü/ses yok. Lisans tarafında güzel haber var — model Apache 2.0 ile gelecek, yani ticari kullanım önünde pratik bir engel bırakmıyor. Reflection, Beam’i açıkça “kurumsal kod yazımı ve ajan iş yükleri için güçlü bir beygir (workhorse) modeli” olarak konumlandırıyor; yani çok-modlu bir asistan değil, kod ve otomasyon odaklı bir motor.
Eğitim tarafındaki rakamlar da ölçeği gösteriyor: 23,8 trilyon token üzerinde, 6.144 adet NVIDIA GB300 GPU ile dört haftadan kısa sürede ön eğitim; ardından 10,5 bin GB300 GPU üzerinde 100 milyonun üzerinde “rollout” ile pekiştirmeli öğrenme (RL). Bir sistem mühendisi olarak beni asıl ilgilendiren, bu ham gücün son kullanıcıya nasıl bir verimlilik olarak yansıdığı.
Benchmark’lar ne söylüyor?
Burada dürüst olmak şart: aşağıdaki sayıların tamamı üretici testi, yani Reflection’ın kendi açıkladığı değerler. Bu satırları yazarken bağımsız kuruluşların (Artificial Analysis gibi) doğrulaması henüz yayınlanmamıştı. Yine de kod/ajan tarafında paylaşılan sonuçlar kayda değer:
- SWE Bench Verified: 80,9
- SWE Bench Pro v2-Hard: 77,2
- Terminal Bench v2.1: 80,1
- DeepSWE v1.1: 44,4
Reflection, Beam’in GLM-5.2 ile “karşılaştırılabilir” skorlara ulaştığını, kod ve ajan görevlerinde Qwen 3.8-Max’e yaklaştığını söylüyor. Referans aldıkları GLM-5.2’nin 744 milyar toplam / 40 milyar aktif parametreyle geldiğini düşünürsek, Beam’in 23 milyar aktif parametreyle benzer sonuçlara ulaşması — eğer bağımsız testler de doğrularsa — gerçekten dikkat çekici.
Asıl iddia: “3-4 kat daha az işlem gücü”
Beam’in en çok konuşulacak kısmı benchmark skorları değil, verimlilik iddiası. Reflection, GLM-5.2 ile karşılaştırılabilir skorları “3-4 kat daha az çıkarım gücüyle” aldığını söylüyor. Bir mühendisin gözünden bu, benchmark tablosundaki bir puandan çok daha önemli bir metrik — çünkü bir modeli üretimde ayakta tutmanın faturası doğrudan token başına işlem maliyetiyle ilgili.
Düşünün: aynı işi yarı yarıya değil, dörtte bir maliyetle yapan bir model, bir ajan hattında saatlerce dönen iş yükünde ciddi bir OPEX farkı demek. 23 milyar aktif parametre de bu iddiayla tutarlı; daha az aktif parametre, daha az FLOP, daha az GPU-saat. Tabii bütün bunlar “eğer bağımsız testler doğrularsa” kaydıyla geçerli. Üreticinin kendi en iyi senaryosunu paylaştığını, gerçek dünyada bağlam uzadıkça ve araç çağrıları (tool calls) arttıkça rakamların oynayabileceğini unutmamak lazım. Benim planım, ağırlıklar çıkınca kendi kod-inceleme ve log-ayrıştırma hatlarımda token başına gerçek maliyeti ölçmek.
Haftanın diğer model gelişmeleri
Beam tek başına haftaya damga vursa da, arka planda hareketlilik sürüyordu. Kısaca özetleyeyim: OpenAI tarafında GPT-6.1 Sol yayına alındı; daha önce duyurulan GPT-6.1 “Astra” ise güvenlik gerekçesiyle geri çekildi. Anthropic, Claude Sonnet 5.5‘i (Opus 5.5’in ardından) kullanıma sundu. Google tarafında Gemini 3.8 Live genel kullanıma açıldı; sesli etkileşim ve ajan orkestrasyonunda iyileştirmeler ön planda, ayrıca kurumsal katmanda kullandıkça-öde (pay-as-you-go) fiyatlandırma ve token indirimleri geldi. xAI cephesinde Grok 4.7 dolaşımdaydı, Mistral ise ürün değil ama 3 milyar euroluk D turu yatırımıyla gündemdeydi. Yani açık modelde Beam konuşulurken, kapalı modeller de boş durmuyor.
Karşılaştırma tablosu
| Model | Tür | Toplam / Aktif Parametre | Bağlam | Not |
|---|---|---|---|---|
| Reflection Beam | Açık ağırlık (Apache 2.0) | 501B / 23B (MoE) | 1M token | Kod + ajan odaklı, metin; ağırlıklar bu ay |
| GLM-5.2 (Z.ai) | Açık ağırlık | 744B / 40B (MoE) | — | Beam’in referans aldığı model |
| Qwen 3.8-Max | Açık/kapalı (kademeli) | Açıklanmadı | — | Kod/ajan tarafında üst sınır referansı |
| GPT-6.1 Sol (OpenAI) | Kapalı | Açıklanmadı | — | Yeni yayınlandı; Astra geri çekildi |
| Gemini 3.8 Live (Google) | Kapalı | Açıklanmadı | — | Sesli ajan ve orkestrasyon odaklı |
Not: Parametre bilgisi açıklanmayan kapalı modeller için hücreler boş bırakıldı. Beam ve GLM-5.2 rakamları üretici duyurularına dayanıyor.
Beam’i şimdi kullanabilir miyim?
Tam olarak değil. Şu an erken erişim kaydı açık; ağırlıklar, teknik rapor ve model kartının Ekim ayı içinde Apache 2.0 lisansıyla yayınlanması bekleniyor. Dağıtımın hyperscaler’lar, neocloud’lar ve açık kaynak kütüphaneleri üzerinden yapılacağı belirtiliyor.
“Açık ağırlık” ile “açık kaynak” aynı şey mi?
Tam olarak değil. Açık ağırlık, modelin eğitilmiş parametrelerinin indirilebilir olması demek; eğitim verisi ve tüm süreç paylaşılmayabilir. Yine de Apache 2.0 lisansı, kendi altyapında çalıştırma ve ticari kullanım açısından pratik bir özgürlük sağlıyor.
Benchmark skorları güvenilir mi?
Şu an için hepsi üreticinin kendi testi. Bağımsız kuruluşların doğrulaması yayınlanana kadar bu sayıları “üreticinin en iyi senaryosu” olarak okumakta fayda var.
Hangi iş yükü için mantıklı?
Metin tabanlı kod yazımı, ajan otomasyonu ve akıl yürütme (reasoning) ağırlıklı hatlar için konumlandırılmış. Görüntü/ses gerektiren çok-modlu senaryolarda şimdilik aradığını bulamazsın.
Değerlendirme
Beam, benim için bu haftanın en umut verici haberi — ağırlıkları henüz test edemesem de. Batı cephesinden Apache 2.0 lisanslı, 501B/23B ölçeğinde, kod ve ajan iş yüklerine odaklı bir açık ağırlık modeli görmek, son dönemde Çinli ekiplerin domine ettiği bu alanda dengeyi değiştirebilir. Beni asıl heyecanlandıran parametre sayısı değil, “benzer kaliteyi 3-4 kat daha az işlem gücüyle” iddiası; eğer bağımsız testler bunu doğrularsa, kendi kendine barındırma (self-hosting) yapan ekipler için ciddi bir maliyet avantajı demek. Şimdilik temkinli-iyimserim: ağırlıklar bu ay düştüğünde kendi iş yüklerimde çevirip gerçek token maliyetini ölçeceğim ve sonuçları buradan paylaşacağım.
Share this content:

Bir yanıt yazın