Yapay Zeka

Reflection AI Beam: 501B Açık Ağırlıklı Modeli İnceledim

DN Dağcan Nural 10 saat önce 7 dk okuma

Her sabah yaptığım gibi bugün de büyük model sağlayıcılarının duyuru akışını taradım ve 5-6 Ekim’in açık ara en dikkat çeken başlığı, benim gibi ajan (agent) iş yükleriyle uğraşan birinin kulağını diken bir haber oldu: Reflection AI, Beam adını verdiği 501 milyar parametreli açık ağırlıklı (open-weight) bir dil modelini duyurdu. Son aylarda açık modelde sahneyi büyük ölçüde Çinli ekipler (DeepSeek, Qwen, GLM) tutuyordu; Batı tarafından bu ölçekte ve bu iddiayla gelen bir “açık ağırlık” modeli uzun zamandır görmemiştik. Bu yüzden bugünkü yazıyı tek bir haberin etrafına kurdum ve haftanın geri kalanını kısaca özetledim.Peşinen söyleyeyim: Beam’in ağırlıkları henüz yayında değil. Reflection, teknik raporu, model kartını ve ağırlıkları “bu ay içinde” yayınlayacağını, şu an erken erişim (early access) ve kırmızı takım (red-team) testi aşamasında olduğunu belirtiyor. Dolayısıyla aşağıdaki değerlendirme kendi test sonuçlarıma değil, resmî duyuruya ve üreticinin paylaştığı benchmark’lara dayanıyor. Ağırlıklar düştüğünde kendi iş yüklerimde çevirip ayrı bir yazı yazacağım.

Beam nedir?

Beam, seyrek (sparse) bir Mixture-of-Experts (MoE) mimarisi kullanıyor. Rakamlar şöyle: toplam 501 milyar parametre, ama her ileri geçişte yalnızca 23 milyar aktif parametre çalışıyor. Bu, GLM gibi modellerde alışkın olduğumuz “dev toplam, küçük aktif” yaklaşımının tam örneği — ve pratikte çıkarım (inference) maliyetini belirleyen şey, toplam değil aktif parametre sayısı olduğu için önemli.

Diğer başlıklar: bağlam penceresi ara eğitim (midtraining) sırasında 1 milyon token’a kadar genişletilmiş; model şimdilik yalnızca metin (text-only), görüntü/ses yok. Lisans tarafında güzel haber var — model Apache 2.0 ile gelecek, yani ticari kullanım önünde pratik bir engel bırakmıyor. Reflection, Beam’i açıkça “kurumsal kod yazımı ve ajan iş yükleri için güçlü bir beygir (workhorse) modeli” olarak konumlandırıyor; yani çok-modlu bir asistan değil, kod ve otomasyon odaklı bir motor.

Eğitim tarafındaki rakamlar da ölçeği gösteriyor: 23,8 trilyon token üzerinde, 6.144 adet NVIDIA GB300 GPU ile dört haftadan kısa sürede ön eğitim; ardından 10,5 bin GB300 GPU üzerinde 100 milyonun üzerinde “rollout” ile pekiştirmeli öğrenme (RL). Bir sistem mühendisi olarak beni asıl ilgilendiren, bu ham gücün son kullanıcıya nasıl bir verimlilik olarak yansıdığı.

Benchmark’lar ne söylüyor?

Burada dürüst olmak şart: aşağıdaki sayıların tamamı üretici testi, yani Reflection’ın kendi açıkladığı değerler. Bu satırları yazarken bağımsız kuruluşların (Artificial Analysis gibi) doğrulaması henüz yayınlanmamıştı. Yine de kod/ajan tarafında paylaşılan sonuçlar kayda değer:

  • SWE Bench Verified: 80,9
  • SWE Bench Pro v2-Hard: 77,2
  • Terminal Bench v2.1: 80,1
  • DeepSWE v1.1: 44,4

Reflection, Beam’in GLM-5.2 ile “karşılaştırılabilir” skorlara ulaştığını, kod ve ajan görevlerinde Qwen 3.8-Max’e yaklaştığını söylüyor. Referans aldıkları GLM-5.2’nin 744 milyar toplam / 40 milyar aktif parametreyle geldiğini düşünürsek, Beam’in 23 milyar aktif parametreyle benzer sonuçlara ulaşması — eğer bağımsız testler de doğrularsa — gerçekten dikkat çekici.

Asıl iddia: “3-4 kat daha az işlem gücü”

Beam’in en çok konuşulacak kısmı benchmark skorları değil, verimlilik iddiası. Reflection, GLM-5.2 ile karşılaştırılabilir skorları “3-4 kat daha az çıkarım gücüyle” aldığını söylüyor. Bir mühendisin gözünden bu, benchmark tablosundaki bir puandan çok daha önemli bir metrik — çünkü bir modeli üretimde ayakta tutmanın faturası doğrudan token başına işlem maliyetiyle ilgili.

Düşünün: aynı işi yarı yarıya değil, dörtte bir maliyetle yapan bir model, bir ajan hattında saatlerce dönen iş yükünde ciddi bir OPEX farkı demek. 23 milyar aktif parametre de bu iddiayla tutarlı; daha az aktif parametre, daha az FLOP, daha az GPU-saat. Tabii bütün bunlar “eğer bağımsız testler doğrularsa” kaydıyla geçerli. Üreticinin kendi en iyi senaryosunu paylaştığını, gerçek dünyada bağlam uzadıkça ve araç çağrıları (tool calls) arttıkça rakamların oynayabileceğini unutmamak lazım. Benim planım, ağırlıklar çıkınca kendi kod-inceleme ve log-ayrıştırma hatlarımda token başına gerçek maliyeti ölçmek.

Haftanın diğer model gelişmeleri

Beam tek başına haftaya damga vursa da, arka planda hareketlilik sürüyordu. Kısaca özetleyeyim: OpenAI tarafında GPT-6.1 Sol yayına alındı; daha önce duyurulan GPT-6.1 “Astra” ise güvenlik gerekçesiyle geri çekildi. Anthropic, Claude Sonnet 5.5‘i (Opus 5.5’in ardından) kullanıma sundu. Google tarafında Gemini 3.8 Live genel kullanıma açıldı; sesli etkileşim ve ajan orkestrasyonunda iyileştirmeler ön planda, ayrıca kurumsal katmanda kullandıkça-öde (pay-as-you-go) fiyatlandırma ve token indirimleri geldi. xAI cephesinde Grok 4.7 dolaşımdaydı, Mistral ise ürün değil ama 3 milyar euroluk D turu yatırımıyla gündemdeydi. Yani açık modelde Beam konuşulurken, kapalı modeller de boş durmuyor.

Karşılaştırma tablosu

Model Tür Toplam / Aktif Parametre Bağlam Not
Reflection Beam Açık ağırlık (Apache 2.0) 501B / 23B (MoE) 1M token Kod + ajan odaklı, metin; ağırlıklar bu ay
GLM-5.2 (Z.ai) Açık ağırlık 744B / 40B (MoE) — Beam’in referans aldığı model
Qwen 3.8-Max Açık/kapalı (kademeli) Açıklanmadı — Kod/ajan tarafında üst sınır referansı
GPT-6.1 Sol (OpenAI) Kapalı Açıklanmadı — Yeni yayınlandı; Astra geri çekildi
Gemini 3.8 Live (Google) Kapalı Açıklanmadı — Sesli ajan ve orkestrasyon odaklı

Not: Parametre bilgisi açıklanmayan kapalı modeller için hücreler boş bırakıldı. Beam ve GLM-5.2 rakamları üretici duyurularına dayanıyor.

Beam’i şimdi kullanabilir miyim?

Tam olarak değil. Şu an erken erişim kaydı açık; ağırlıklar, teknik rapor ve model kartının Ekim ayı içinde Apache 2.0 lisansıyla yayınlanması bekleniyor. Dağıtımın hyperscaler’lar, neocloud’lar ve açık kaynak kütüphaneleri üzerinden yapılacağı belirtiliyor.

“Açık ağırlık” ile “açık kaynak” aynı şey mi?

Tam olarak değil. Açık ağırlık, modelin eğitilmiş parametrelerinin indirilebilir olması demek; eğitim verisi ve tüm süreç paylaşılmayabilir. Yine de Apache 2.0 lisansı, kendi altyapında çalıştırma ve ticari kullanım açısından pratik bir özgürlük sağlıyor.

Benchmark skorları güvenilir mi?

Şu an için hepsi üreticinin kendi testi. Bağımsız kuruluşların doğrulaması yayınlanana kadar bu sayıları “üreticinin en iyi senaryosu” olarak okumakta fayda var.

Hangi iş yükü için mantıklı?

Metin tabanlı kod yazımı, ajan otomasyonu ve akıl yürütme (reasoning) ağırlıklı hatlar için konumlandırılmış. Görüntü/ses gerektiren çok-modlu senaryolarda şimdilik aradığını bulamazsın.

Değerlendirme

Beam, benim için bu haftanın en umut verici haberi — ağırlıkları henüz test edemesem de. Batı cephesinden Apache 2.0 lisanslı, 501B/23B ölçeğinde, kod ve ajan iş yüklerine odaklı bir açık ağırlık modeli görmek, son dönemde Çinli ekiplerin domine ettiği bu alanda dengeyi değiştirebilir. Beni asıl heyecanlandıran parametre sayısı değil, “benzer kaliteyi 3-4 kat daha az işlem gücüyle” iddiası; eğer bağımsız testler bunu doğrularsa, kendi kendine barındırma (self-hosting) yapan ekipler için ciddi bir maliyet avantajı demek. Şimdilik temkinli-iyimserim: ağırlıklar bu ay düştüğünde kendi iş yüklerimde çevirip gerçek token maliyetini ölçeceğim ve sonuçları buradan paylaşacağım.


 

Share this content:

0 Yorum
Paylaş
DN

Dağcan Nural

1988 İstanbul doğumluyum. Bilgisayar dünyasına olan hayranlığım çok küçük yaşlarda başladı. Bu sebeple sistem alanında kendimi geliştirmeye karar verdim. Celal Bayar Üniversitesi Bilgisayar Programcılığı ve Anadolu Üniversitesi İşletme mezunuyum. Beykent Üniversitesi'nde Yönetim Bilişim Sistemleri Bölümü'nde yüksek lisans eğitimimi tamamladım. 2005 yılında Bilge Adam Sistem & Network Mühendisliği eğitimi aldım. Hemen ardından IT dünyasına giriş yaptım. Collezione şirketinde 2006 - 2018 yılları arasında Sistem Uzmanı olarak görev yaptım. 2018 Temmuz ayından beri LCWAIKIKI şirketinde System Engineer pozisyonunda çalışmaktayım. Sektörde 20 yıllık deneyime sahibim. Birçok önemli projede görev aldım. Şu an Yapay Zeka Yüksek Lisansı yapıyorum. Oldukça güzel projeler geliştiriyorum. Sayfanın en alt kısmından Linkedin profilime ulaşabilirsiniz. Bilgi ve tecrübemi bu blog üzerinde üzerinde paylaşıyorum.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir