Mistral Large 4 ile Haftanın AI Model Haberleri
Mistral Large 4 “Le Chonk” ne sunuyor?
Mistral’in “Le Chonk” lakabını taktığı Large 4, 1,05 trilyon toplam parametreli ama her token için yalnızca 49 milyar aktif parametre kullanan granüler bir Mixture-of-Experts (MoE) mimarisi. Yani her istekte modelin ağırlıklarının yaklaşık yüzde 5’i çalışıyor; bu da pratikte 1 trilyonluk bir modeli donanım açısından taşınabilir kılan en kritik tasarım kararı. Kendi iş yüklerimde MoE’nin çekici yanı tam da bu: devasa kapasite, görece makul çıkarım maliyeti.
Mistral’in model dokümantasyonuna göre bağlam penceresi 1 milyon token (bazı üçüncü taraf uç noktalar şimdilik 524K listeliyor). Model natif görüntü girişini destekliyor ve 1,6 milyar parametrelik ayrı bir görüntü kodlayıcıya sahip. 160’tan fazla dili — tüm resmî AB dilleri dahil — kapsadığı belirtiliyor. Eğitim tamamen sıfırdan, Avrupa veri merkezlerinde 3.800 NVIDIA Grace Blackwell çipi üzerinde yapılmış. Uzmanı sayısı, top-k yönlendirme gibi mimari ayrıntıların ise ağırlıklarla birlikte açıklanacağı söyleniyor.
Benchmark’lar: üretici testi mi, bağımsız test mi?
Burada dürüst olmak gerekiyor; sayıların kaynağı sonucu kadar önemli. Mistral’in kendi paylaştığı (henüz bağımsız olarak yeniden üretilmemiş) rakamlar şöyle: Cybench’te %93, CyberGym-E2E’de %82, DeepSWE v1.1’de %61,7, Terminal-Bench 4.0’da %28,3 ve Artificial Analysis Coding Agent Index birleşiğinde %49,8. Siber güvenlik tarafı modelin en güçlü yanı gibi duruyor — Mistral, açık kaynak projelerde yama uygulamada %82 ile AA Cyber Index’te ilk beşe girdiğini söylüyor. Kodlama benchmark’larında ise açıkça “Astra gibi frontier modellerin gerisinde” kaldığını kabul ediyor.
Bağımsız tarafta birkaç veri daha var ve bence asıl kıymetli olanlar bunlar: Surge AI’nin kör insan değerlendirmesinde Large 4, 5 model arasında 3,74/5 ile ikinci olmuş; aynı testte Claude Opus 5 4,22 ile önde, GLM-5.3 ise 3,60. Lakera B3 güvenlik testinde saldırıların %93,3’üne direnmiş. Yani tablo net: güvenlik ve çok dillilik güçlü, saf kodlamada kapalı amiral gemilerini henüz yakalayamıyor.
Hızlı karşılaştırma tablosu
| Özellik | Mistral Large 4 | Not |
|---|---|---|
| Mimari | MoE — 1,05T toplam / 49B aktif | Granüler MoE, hibrit instruct+reasoning |
| Bağlam penceresi | 1M token | Resmî doküman; bazı uç noktalar 524K |
| Çok dillilik | 160+ dil | Tüm resmî AB dilleri dahil |
| Multimodal | Natif görüntü girişi | 1,6B parametreli görüntü kodlayıcı |
| Kör insan değerlendirmesi (Surge AI) | 3,74/5 (5 model içinde 2.) | Bağımsız; Claude Opus 5 = 4,22 |
| Fiyat (Mistral API) | $1,36 giriş / $4,18 çıkış (1M token) | Önbellekli giriş: $0,14 |
| Açık ağırlık | Ekim sonunda planlanıyor | Lisans henüz açıklanmadı |
Fiyat, erişim ve açık ağırlık meselesi
Model şu an Mistral’in bulut platformunda genel önizlemede. API fiyatı 1 milyon token başına 1,36 dolar giriş / 4,18 dolar çıkış, önbellekli giriş ise 0,14 dolar. OpenRouter üzerinden üçüncü taraf barındırmalı promosyon fiyatı 0,68 / 2,09 dolar seviyesinde. Mistral ağırlıkları “ay içinde” — yani Ekim sonuna doğru — yayımlamayı planlıyor; ancak lisans koşulları henüz netleşmedi. “Open-source” başlığı atılsa da, lisans açıklanmadan bunu ne kadar özgürce self-host edebileceğimizi şimdiden söylemek doğru olmaz. Benim tavsiyem: üretim kararını ağırlıklar ve lisans çıkana kadar beklemek, şimdilik API önizlemesinde kendi görevlerinizle denemek.
Modele henüz kendi ortamımda erişemedim; ağırlıklar yayımlanmadı ve değerlendirmem tamamen resmî duyuru ile bağımsız benchmark’lara dayanıyor. Ağırlıklar çıktığında kendi veri hattımda test edip sonuçları ayrı bir yazıda paylaşacağım.
Aynı haftadan: DevDay 2026 ve Nano Banana 2.1
OpenAI tarafında DevDay 2026 kapsamında GPT-6.1 Sol duyuruldu; kodlama, bilgisayar kullanımı ve profesyonel görevlere odaklı bir güncelleme. OpenAI’ye göre birçok değerlendirmede GPT-6 Astra’ya “yaklaşıyor” ama fiyatı Astra’nın beşte biri, önbellekli giriş 1M token başına 0,10 dolar. Yanında Agents API’ye bilgisayar kullanımı eklenmesi, Codex’in bulutta çalışabilmesi ve GitHub/GitLab için otomatik kod incelemesi gibi geliştirici özellikleri geldi. Topluluktan “mevcut ajan platformlarının çok ötesine geçiyor mu?” sorusu da yükseldi — makul bir şüphe.
Google cephesinde ise görsel üretim modeli Nano Banana 2.1 Gemini servislerinde yayılmaya başladı; daha hızlı ve daha gerçekçi üretim ile yüksek çözünürlük vaadi öne çıkıyor. Bunu henüz detaylı test etmedim, ama görsel iş akışı olanların radarında tutması gereken bir güncelleme.
Bir sistem mühendisi olarak değerlendirmem
Bu haftanın asıl hikâyesi bence Mistral Large 4. Sebebi illa en yüksek skor değil — kodlamada hâlâ kapalı frontier modellerin gerisinde. Asıl mesele, Avrupa’da sıfırdan eğitilmiş, çok dilli, siber güvenlikte güçlü ve ağırlıkları açılması planlanan trilyon parametrelik bir modelin masada olması. Veri egemenliği ve self-host ihtiyacı olan ekipler için bu, tek bir skordan daha değerli. GPT-6.1 Sol’un agresif fiyatlaması ise maliyet tarafını zorlayan güzel bir hamle. Kısaca: sayıları üretici-bağımsız ayrımıyla okuyun, kararı ağırlıklar çıkınca verin.
Mistral Large 4 açık kaynak mı?
Mistral ağırlıkları Ekim sonuna doğru yayımlamayı planlıyor, ancak lisans koşulları henüz açıklanmadı. Bu yüzden şu an tam olarak “self-host edilebilir açık kaynak” demek erken; model şimdilik API önizlemesinde.
Mistral Large 4 kodlamada en iyisi mi?
Hayır. Mistral’in kendi açıklamasına göre bile kodlama benchmark’larında GPT-6 Astra gibi frontier modellerin gerisinde. Güçlü olduğu alanlar siber güvenlik, çok dillilik ve genel insan değerlendirmesi.
Bağlam penceresi ne kadar?
Mistral’in resmî dokümanına göre 1 milyon token. Bazı üçüncü taraf uç noktalar şimdilik 524K token listeliyor.
GPT-6.1 Sol neden önemli?
Çünkü GPT-6 Astra’ya yakın performansı, Astra’nın yaklaşık beşte biri fiyata sunuyor; bu da ajan ve kodlama iş yüklerinde maliyeti ciddi şekilde düşürebilir.
Değerlendirmem
6-7 Ekim, model tarafında yoğun bir pencere oldu: açık ağırlık iddiasıyla gelen trilyon parametrelik Mistral Large 4, ucuzlayan GPT-6.1 Sol ve hızlanan Nano Banana 2.1. Benim önceliğim Large 4; çünkü açık ağırlık + çok dillilik + Avrupa altyapısı kombinasyonu, tek bir benchmark skorundan daha stratejik. Yine de kritik not değişmiyor: skorların üretici mi bağımsız mı olduğuna bakın, ve üretim kararını ağırlıklar ile lisans netleşene kadar erteleyin. Ağırlıklar çıktığında kendi testlerimle geri döneceğim.
Share this content:

Bir yanıt yazın