Yapay Zeka

Yeni AI Modelleri: Haiku 5.5 ve Mistral Large 4

DN Dağcan Nural 5 saat önce 6 dk okuma

Bir sistem mühendisi olarak haftalardır takip listemdeki “küçük ve hızlı model” rafı hareketleniyordu; bu hafta iki kayda değer çıkış oldu. Anthropic, 7 Ekim’de Claude Haiku 5.5‘i duyurdu ve küçük bir modele 1 milyon token bağlam ile “effort” (çaba) kontrolü koydu. Bir gün öncesinde ise Mistral, Mistral Large 4 (“Le Chonk”) ile Avrupa’da sıfırdan eğitilmiş 1,05 trilyon parametreli devasa bir MoE modelini önizlemeye açtı. İkisi de henüz elimde test edemediğim modeller; bu yüzden aşağıdaki değerlendirme resmî duyurulara ve bağımsız benchmark verilerine dayanıyor, kişisel bir “şunu çalıştırdım” iddiası değil. Yeni AI modellerini her zaman aynı soruyla okurum: benim iş yüküme hangi fiyata ne katıyor?

Claude Haiku 5.5: Küçük modelde 1M bağlam ve çaba kontrolü

Haiku serisi Anthropic’in en ucuz ve en hızlı kademesi; bu sürümün asıl haberi fiyat değil, kapasite. Anthropic’in belirttiği girdi/çıktı fiyatı 1 milyon token başına 0,10$ girdi ve 0,50$ çıktı. Bu rakamlarla, GPT-6 Luna gibi aynı fiyat aralığındaki rakiplerle doğrudan karşılaştırılıyor. İlgimi çeken iki şey var: ilki, bir “mini” modele koyulan 1M token bağlam penceresi (128k’ya kadar çıktı); ikincisi, bu serideki ilk effort/çaba kontrolü — yani modele “hızlı ve ucuz cevap ver” ile “daha fazla düşün” arasında bir ayar verebiliyorsunuz. Bir pipeline tasarlayan biri için bu ayar, maliyet-kalite eğrisini elle çevirebilmek demek.

Bağımsız tarafta, değerlendirme platformu Vals AI modeli kendi test paketinden geçirmiş (bunlar üretici beyanı değil, üçüncü taraf ölçümleri). Genel Vals Index puanı %54,31 ile 45 model içinde 16. sırada — yani orta kademe. Ama ayrıntıya inince modelin karakteri çıkıyor ortaya: kodlama ve güvenlik tarafında sınıf atlıyor. Vibe Code Bench’te %90,44 ile 110 model arasında 3., CyberBench’te %75,48 ile 5., tıbbi not çıkarımında (MedScribe) %89,54 ile 6. sırada. Buna karşılık hukuk ajanı (Harvey) ve SRE/operasyon benchmark’larında dibe vuruyor. Benim okumam net: bu model genel amaçlı bir “akıl hocası” değil, ucuz ve hızlı bir kod/sınıflandırma/özet iş gücü.

Mistral Large 4 “Le Chonk”: Avrupa’nın 1 trilyonluk MoE hamlesi

Diğer uçta, boyutuyla konuşan bir model var. Mistral Large 4, toplam 1,05 trilyon parametreli ama token başına yalnızca ~49 milyar parametresini aktive eden granüler bir Mixture-of-Experts (MoE) mimarisi kullanıyor — yani “devasa ama token başına verimli” tasarım felsefesi. 1,6B’lik bir görü (vision) kodlayıcıyla çok modlu; Mistral’in dokümanlarına göre bağlam penceresi 1M token (OpenRouter uç noktası ise 524K listeliyor, bu farkı not düşmek lazım). En dikkat çekici detay teknik değil, jeopolitik: model, Avrupa veri merkezlerinde 3.800 NVIDIA Grace Blackwell GPU üzerinde, 160’tan fazla dili kapsayan veriyle sıfırdan eğitilmiş.

Burada dürüst olmak gerekiyor: Mistral’in paylaştığı benchmark’lar üretici beyanıdır ve çoğu henüz bağımsız olarak tekrarlanamadı. Mistral; Cybench’te %93, CyberGym-E2E’de %82, DeepSWE v1.1’de %61,7 bildiriyor. Surge AI ile yapılan kör insan değerlendirmesinde 5 model arasında 3,74/5 ile ikinci olmuş — ama aynı testte Claude Opus 5, 4,22 ile önde. İki pratik uyarı: açık ağırlıklar henüz yayında değil (Ekim sonu bekleniyor, yani şimdilik self-hosting yok) ve model “public preview” aşamasında. Önizleme API fiyatı 1M token başına 1,36$ girdi / 4,18$ çıktı; OpenRouter’da tanıtım fiyatı 0,68$ / 2,09$. Yani Haiku ile aynı ligde değil — bu bir “amiral gemisi ajan modeli” konumlandırması.

Fiyat ve konumlandırma: İki modeli yan yana koyunca

İki modeli aynı tabloya koymak kafa karıştırıcı olabilir çünkü farklı işler için tasarlanmışlar. Yine de karar verirken baktığım satırlar şunlar:

Özellik Claude Haiku 5.5 Mistral Large 4
Üretici / Tarih Anthropic — 7 Eki 2026 Mistral AI — 6 Eki 2026 (önizleme)
Mimari Küçük/hızlı kademe MoE — 1,05T toplam / ~49B aktif
Bağlam penceresi 1M token (128k çıktı) 1M token (bazı uçlar 524K)
Girdi / Çıktı (1M token) 0,10$ / 0,50$ 1,36$ / 4,18$ (promo 0,68$ / 2,09$)
Öne çıkan yön Kodlama, güvenlik, özet (bağımsız: Vals AI) Ajan/kurumsal, çok dillilik (üretici beyanı)
Açık ağırlık Hayır Henüz değil (Ekim sonu bekleniyor)

Benim iş yüküme göre ayrım basit: yüksek hacimli, tekrarlı ve maliyete duyarlı işler (log sınıflandırma, kod incelemesi ön elemesi, doküman özeti) için Haiku 5.5 fiyat-performansta çok agresif. Karmaşık, çok adımlı ajan akışları ve çok dilli kurumsal senaryolar içinse Large 4 daha doğru raf — ama açık ağırlıklar çıkıp bağımsız testler gelene kadar ihtiyatlı olurum.

Günün diğer model gelişmeleri

Bu hafta sadece bu ikisi yoktu. Google tarafında görsel üretim modeli Gemini Nano Banana 2.1 (6 Ekim) listelendi. Z.AI, GLM 5.3 Fast ile hız odaklı bir sürümü 7 Ekim’de ekledi. Daha ilginç bir uç nokta: xAI’nin Grok Bot‘u 9 Ekim’de kendi e-posta kutusuna kavuştu (@mail.grokbot.com) — modelden çok “ajan altyapısı” tarafında bir hamle. Ayrıca Anthropic’in, kendi iç değerlendirmelerinde ajanları güvenilir biçimde kontrol etmekte zorlandığı için “canlı internet erişimini bir süreliğine kapattığını” belirtmesi, model yarışının yanında güvenlik/kontrol başlığının da hızla olgunlaştığını gösteriyor. Bunları ayrı ayrı deneyip ilerleyen günlerde değineceğim.

Claude Haiku 5.5 ne kadar?

Anthropic’in açıkladığı fiyat 1 milyon token başına 0,10$ girdi ve 0,50$ çıktı. Bu, modeli en ucuz kademeye yerleştiriyor.

Haiku 5.5 gerçekten 1 milyon token bağlam destekliyor mu?

Evet, duyuruya ve bağımsız liste verilerine göre 1M token bağlam ve 128k’ya kadar çıktı destekliyor. Bu, küçük kademe bir model için dikkat çekici.

Mistral Large 4’ün açık ağırlıkları indirilebilir mi?

Şu an hayır. Model “public preview” aşamasında; açık ağırlıkların Ekim sonunda yayınlanması bekleniyor, lisans koşulları henüz netleşmedi.

Bu modellerin benchmark’ları güvenilir mi?

Ayrım önemli: Haiku 5.5 rakamları bağımsız bir platform olan Vals AI’dan; Mistral Large 4’ün kodlama/güvenlik skorları ise büyük ölçüde üretici beyanı ve henüz bağımsız doğrulanmadı.

Değerlendirmem

Bu hafta yeni AI modelleri cephesinde iki farklı strateji aynı anda masaya kondu: Anthropic, küçük modeli ucuzlatıp kapasitesini (1M bağlam + effort kontrolü) büyüterek “hacimli işi ucuza” diyor; Mistral ise devasa bir MoE ile “Avrupa menşeli, kurumsal ajan” konumunu güçlendiriyor. Henüz ikisini de kendi ortamımda test etmedim, bu yüzden son sözü bağımsız benchmark’lar ve — Mistral özelinde — açık ağırlıkların çıkışına bırakıyorum. Pratik tavsiyem: üretim hattınızda maliyet sıkıntısı varsa Haiku 5.5’i küçük bir pilotla deneyin; çok adımlı ajan mimarisi kuruyorsanız Large 4’ü radarda tutun ama bağımsız sonuçları bekleyin. İlerleyen günlerde ikisini de elime alıp gerçek iş yüküyle test edince buraya somut sayılarla döneceğim.


 

Share this content:

0 Yorum
Paylaş
DN

Dağcan Nural

1988 İstanbul doğumluyum. Bilgisayar dünyasına olan hayranlığım çok küçük yaşlarda başladı. Bu sebeple sistem alanında kendimi geliştirmeye karar verdim. Celal Bayar Üniversitesi Bilgisayar Programcılığı ve Anadolu Üniversitesi İşletme mezunuyum. Beykent Üniversitesi'nde Yönetim Bilişim Sistemleri Bölümü'nde yüksek lisans eğitimimi tamamladım. 2005 yılında Bilge Adam Sistem & Network Mühendisliği eğitimi aldım. Hemen ardından IT dünyasına giriş yaptım. Collezione şirketinde 2006 - 2018 yılları arasında Sistem Uzmanı olarak görev yaptım. 2018 Temmuz ayından beri LCWAIKIKI şirketinde System Engineer pozisyonunda çalışmaktayım. Sektörde 20 yıllık deneyime sahibim. Birçok önemli projede görev aldım. Şu an Yapay Zeka Yüksek Lisansı yapıyorum. Oldukça güzel projeler geliştiriyorum. Sayfanın en alt kısmından Linkedin profilime ulaşabilirsiniz. Bilgi ve tecrübemi bu blog üzerinde üzerinde paylaşıyorum.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir