Blog

Xiaomi MiMo-V2.6 Pro ve Flash: Açık Modellerde Yeni Maliyet ve Ajanlık Dengesi

Xiaomi MiMo-V2.6 Pro ve Flash modellerini mimari, benchmark, fiyat, token hesabı ve üretim kullanım senaryolarıyla karşılaştırıyoruz.

Xiaomi MiMo-V2.6 Pro ve Flash: Açık Modellerde Yeni Maliyet ve Ajanlık Dengesi

Xiaomi MiMo-V2.6 Pro ve Flash: Açık Modellerde Yeni Maliyet ve Ajanlık Dengesi

Xiaomi MiMo-V2.6 Pro ve Flash, 22 Eylül 2026'da aynı aile içinde iki farklı üretim tercihini bir araya getiriyor. Pro, 1,02 trilyon toplam parametre ve 42 milyar etkin parametreyle en zor uzun ufuklu görevleri hedefliyor. Flash ise 309 milyar toplam, 15 milyar etkin parametreyle daha düşük gecikme ve maliyet sunuyor. İki model de metin, görsel, video ve ses girdilerini tek bir omurga içinde işleyebiliyor; bağlam pencereleri 1 milyon tokena kadar çıkıyor.[Xiaomi resmi duyurusu]

Bu sürümün asıl önemi yalnızca benchmark puanlarında değil. Xiaomi, modelin öğrenme sürecini de görünür kıldı: yaklaşık altı günlük canlı takviyeli öğrenme (reinforcement learning, RL) çalışmasında 750 bin civarında yörünge kullandı ve iki model için toplamda milyonlarca dolarlık eğitim hesabını açıkladı. Böylece tartışma, "hangi model daha zeki" sorusundan "hangi kaliteyi hangi iş yükünde kaç paraya alıyoruz" sorusuna kayıyor.

Aşağıdaki karşılaştırma, Xiaomi'nin tablolarını, model kartlarını, teknik raporunu, bağımsız ölçümleri ve geliştirici topluluğundaki ilk gözlemleri birlikte okur. Sonuç basit: Pro daha yüksek kalite tavanı için, Flash ise yüksek hacimli ajan ve kodlama işleri için daha mantıklı başlangıç noktası.

MiMo-V2.6 Pro ve Flash hangi ihtiyacı çözüyor?

Yeni aile, sıradan sohbet modelinden çok görev tamamlayan ajanları hedefliyor. Uzun bir kod deposunu okumak, terminal komutları çalıştırmak, görsel bir arayüzü kullanmak, tarayıcıda araştırma yapmak ve sonucu doğrulamak aynı oturumun parçası olabiliyor. Xiaomi'nin model kartlarında bu yaklaşım, kodlama, genel ajan görevleri, görsel görevler ve siber güvenlik ortamlarını tek RL çalışmasında birleştiren "You Only RL Once" tasarımıyla açıklanıyor.[Pro model kartı][Flash model kartı]

Bu yönelim, daha önce incelediğimiz Kimi K2.6 ve MiniMax M3 yazılarındaki açık ağırlık rekabetinin yeni aşamasını gösteriyor. Artık sadece model boyutu veya genel bilgi puanı konuşulmuyor. Araç çağrılarının kararlılığı, uzun görevlerde hata sonrası toparlanma ve bir işi daha az tokenla bitirme becerisi, gerçek maliyeti belirliyor.

Teknik özellikler: Aynı fikir, iki farklı ölçek

ÖzellikMiMo-V2.6-ProMiMo-V2.6-Flash
Toplam parametre1,02 trilyon309 milyar
Token başına etkin parametre42 milyar15 milyar
Bağlam penceresi1 milyon token1 milyon token
Girdi modaliteleriMetin, görsel, video, sesMetin, görsel, video, ses
Transformer katmanı70, 60 SWA ve 10 GA48, 39 SWA ve 9 GA
Uzman yapısı384 uzman, token başına 8 etkin256 uzman, token başına 8 etkin
Maksimum çıktı128K token128K token
MTP5 katmanlı spekülatif çözücü5 katmanlı spekülatif çözücü

Her iki model de seyrek Uzman Karışımı (Mixture of Experts, MoE) kullanıyor. Her token için bütün ağı çalıştırmak yerine seçilen uzmanlar etkinleşiyor. Bu, toplam model kapasitesini büyütürken tek tokenın hesap maliyetini kontrol altında tutuyor. Pro'nun toplam kapasitesi daha yüksek; Flash ise aynı etkin uzman sayısıyla daha küçük bir yönlendirme ve katman yapısı kullanıyor. Bu nedenle Pro kalite tavanına, Flash throughput ve maliyet eğrisine oynuyor.

Omnimodal giriş iddiasını da doğru okumak gerekiyor. Pro ve Flash, metin, görsel, video ve ses anlayışını aynı model ailesinde sunuyor. Bu, görüntüden kod üretme veya video içindeki bir arayüz akışını analiz etme gibi işlerde ayrı bir görsel model bağlama ihtiyacını azaltabilir. Ancak gerçek ürünlerde modalite başına gecikme, dosya boyutu, desteklenen API formatı ve hata oranı ayrıca ölçülmeli. Model kartı bu yetenekleri açıklar, fakat her üretim senaryosu için bağımsız sonuç yayımlamaz.

MiMo-V2.6 Pro ve Flash için omnimodal MoE mimarisi

Kaynak: Xiaomi MiMo-V2.6-Pro model kartı.

Asıl teknik fikir: seyrek dikkat ve çoklu token tahmini

Flash'ın maliyet ve hız profilini açıklayan temel mekanizma, kayan pencere dikkati (Sliding Window Attention, SWA) ile küresel dikkatin (Global Attention, GA) birlikte kullanılması. Xiaomi, beş SWA katmanının ardından bir GA katmanı yerleştiriyor. SWA yalnızca 128 tokenlık yerel pencereye bakıyor; GA ise uzun menzilli bilgiyi periyodik olarak bütün bağlama yayıyor. Bu 5:1 oranı, standart tam dikkatin uzun dizilerde büyüyen anahtar-değer önbelleği yükünü azaltıyor.

Teknik rapora göre bu yapı, uzun bağlamlarda KV önbelleği ve dikkat hesaplaması için yaklaşık altı kat azalma sağlayabiliyor. Buradaki kazanç, yalnızca teorik karmaşıklıkta kalmıyor. Ajan oturumlarında her araç çağrısı geçmişe yeni token eklediği için KV önbelleği GPU belleğini hızla tüketir. Sabit boyutlu yerel pencereler, yüzlerce adımlı iş akışlarında belleği daha öngörülebilir yapar. Global katmanlar ise modelin önceki bölümlerdeki kritik bilgiyi tamamen unutmasını engellemeye çalışır.[MiMo-V2-Flash teknik raporu]

İkinci mekanizma Çoklu Token Tahmini (Multi-Token Prediction, MTP). Model, bir sonraki tokenı tek tek üretmek yerine hafif bir taslak modülle birkaç sonraki token için tahmin yapıyor. Ana model bu taslağı paralel doğruluyor, hatalı bölümden sonra üretime devam ediyor. Xiaomi'nin Flash ölçümlerinde üç MTP katmanı 2,8 ile 3,6 token arasında kabul uzunluğu ve 2,0 ile 2,6 kat arasında etkin hızlanma sağladı. Bu sonuç donanıma, batch boyutuna, prompt uzunluğuna ve kabul oranına bağlıdır; her API çağrısında sabit üç kat hız beklemek doğru olmaz.

Bu yaklaşım, sitedeki Gemma 4'ün Multi-Token Prediction incelemesiyle birlikte okununca daha anlamlı hale geliyor. MTP artık sadece eğitimde kalite artıran bir yardımcı kayıp değil. Xiaomi, onu doğrudan çıkarım hızını yükselten ve RL sırasında daha fazla yörünge toplamayı mümkün kılan bir üretim bileşenine dönüştürüyor.

Post-training tarafında Xiaomi, Flash teknik raporunda Multi-Teacher On-Policy Distillation (MOPD) adını verdiği yöntemi anlatıyor. Alan uzmanı öğretmen modeller, öğrencinin kendi ürettiği yörüngelere token düzeyinde yoğun geri bildirim veriyor. Bu yöntem, farklı uzmanlıkları tek bir öğrenci modelinde birleştirmeyi ve klasik SFT artı RL sürecine kıyasla daha az hesapla öğretmen yeteneklerini aktarmayı hedefliyor. V2.6'da bu fikir Groupwise Reward Synthesis, Groupwise Advantage Redistribution ve MOPD2 ile daha geniş ajan eğitim döngüsüne bağlanıyor.

Benchmark tablosu: Pro nerede önde, Flash nerede yeterli?

Aşağıdaki puanlar Xiaomi'nin V2.6 resmi karşılaştırması ve model kartlarında verilen sonuçlardır. Aynı benchmarkın promptu, araç seti, örnek sayısı ve test sürümü değişirse puan da değişebilir. Bu yüzden tabloyu mutlak lig tablosu değil, modelin güçlü ve zayıf yönlerini gösteren bir profil olarak okumak gerekir.

BenchmarkProFlashNe ölçüyor?
DeepSWE v1.171,967,9Uzun ufuklu yazılım mühendisliği
ProgramBench26,526,0Programlama görevleri
MiMo Code Bench63,261,2Xiaomi iç kod ajanı testi
AutomationBench v1.0.653,152,3Genel otomasyon ve araç kullanımı
Toolathlon-Verified76,973,6Çoklu araç görevleri
Terminal Bench 4.034,928,8Terminal tabanlı ajanlık
OSWorld-Verified82,080,8Grafik arayüzde bilgisayar kullanımı
JobBench62,061,2İş akışı tamamlama
CyberGym94,095,1Siber güvenlik görevleri
ExploitGym17,86,0Exploit geliştirme görevleri
MiMo Visual Coding72,371,5Görsel kodlama

Pro'nun genel resmi güçlü ama kusursuz değil. DeepSWE v1.1'de 71,9 puan, Xiaomi'nin karşılaştırdığı bazı kapalı modellerin gerisinde kalıyor. ProgramBench'te de 26,5 puanla Claude Opus 5'in 37 puanının altında. Buna karşılık AutomationBench'te Pro 53,1 ile karşılaştırmadaki tüm modelleri geçiyor ve Toolathlon-Verified'da 76,9 puan alıyor. Yani model, her sentetik sınavda birinci olmaktan çok araç kullanan, çok adımlı işlerde dengeli performans arıyor.

Flash ile Pro arasındaki fark çoğu ajan testinde beklenenden küçük. AutomationBench'te fark 0,8 puan, MiMo Code Bench'te 2 puan, OSWorld-Verified'da 1,2 puan. Terminal Bench 4.0'da fark 6,1 puana çıkıyor. Bu ayrım, Flash'ın yüksek hacimli günlük kod ve otomasyon işleri için neden ilgi çekici olduğunu açıklıyor. Siber güvenlikte Flash'ın CyberGym'de Pro'yu geçmesi de tek bir modelin her alanda otomatik olarak üstün olmadığını gösteriyor.

Bağımsız Artificial Analysis ölçümü Pro için 46,32 Intelligence Index skoru bildiriyor. Bu bileşik indeksin kendi metodolojisi vardır ve Xiaomi'nin iç testlerinden farklıdır. Artificial Analysis ayrıca Xiaomi API'sinde Pro için yaklaşık 124,5 token/s çıktı hızı ve varsayılan 7:2:1 önbellek, giriş, çıkış karışımıyla 1 milyon token başına yaklaşık 0,18 dolar harmanlanmış fiyat gösteriyor.[Artificial Analysis Pro sağlayıcı ölçümü] Bağımsız ölçümde Flash V2.6 sayfası henüz aynı kapsamda görünmediği için Pro ve Flash için tek bir dış indeks üzerinden doğrudan sıralama yapmak doğru olmaz.

MiMo-V2.6-Pro zekâ ve maliyet Pareto grafiği

Kaynak: Xiaomi'nin V2.6 duyurusu ve Artificial Analysis verisi.

Fiyatlandırma: token hesabını kendiniz yapın

Xiaomi'nin yurtdışı gerçek zamanlı API fiyatları milyon token başına veriliyor. Önbellek isabeti, daha önce işlenmiş prefix içeriği için çok daha düşük fiyat anlamına geliyor. Önbellek yazımı duyurunun yayımlandığı tarihte sınırlı süre ücretsiz. Web araması ise token fiyatına dahil değil, çağrı başına ayrıca ücretlendiriliyor.[Resmi fiyatlandırma dokümanı]

ModelGirdi, cache hitGirdi, cache missÇıktıBatch girdi, missBatch çıktı
MiMo-V2.6-Flash$0,0028$0,14$0,28$0,07$0,14
MiMo-V2.6-Pro$0,0036$0,435$0,87$0,2175$0,435
Pro UltraSpeed$0,036$4,35$8,70DesteklenmiyorDesteklenmiyor

500 bin yeni girdi ve 100 bin çıktıdan oluşan bir görevde hesap nettir. Flash için 0,5 × 0,14 + 0,1 × 0,28 = 0,098 dolar ödersiniz. Aynı görev Pro'da 0,5 × 0,435 + 0,1 × 0,87 = 0,3045 dolar tutar. Batch API uygunsa bu değerler yaklaşık 0,049 ve 0,15225 dolara iner. Bu örnekte Pro, Flash'ın yaklaşık 3,1 katı maliyete sahip; fakat zor görevlerde daha az tekrar ve daha az insan müdahalesi gerekiyorsa toplam proje maliyeti aynı oranda artmayabilir.

Önbellekli ajan döngüsü daha da farklı görünür. 400 bin token cache hit, 100 bin yeni girdi ve 100 bin çıktı için Flash hesabı 0,04312 dolar, Pro hesabı 0,13194 dolar olur. Sistem promptunu, araç tanımlarını ve sabit proje bağlamını cache'e almak bu yüzden önemlidir. Uzun bağlamı her turda yeniden gönderen bir entegrasyon, ucuz modelde bile gereksiz fatura üretir.

OpenRouter Pro sayfası ve Flash sayfası aynı liste fiyatlarını, yaklaşık 1 milyon token bağlamı ve Xiaomi sağlayıcısını gösteriyor. OpenRouter'ın ilk gün verisinde Flash için P50 79 token/s, Pro için 39 token/s görülüyor. Bu değerler kısa dönemli ve sağlayıcıya özgü ölçümlerdir. Kendi bölgenizde, kendi prompt uzunluğunuzla test yapmadan SLA vermeyin.

Hangi model hangi projeye uygun?

  • Flash'ı seçin: Çok sayıda kısa ve orta uzunlukta kod düzeltmesi, müşteri destek otomasyonu, doküman sınıflandırma, düzenli araç çağrıları ve maliyetin kalite kadar önemli olduğu ürün akışları için. 52,3 AutomationBench ve 80,8 OSWorld puanları, günlük ajan işlerinde Pro'ya yakın bir taban sunuyor.
  • Pro'yu seçin: Büyük kod depoları, karmaşık araştırma, görsel ve ses girdisini birlikte kullanan iş akışları, siber güvenlik analizleri, uzun planlama ve hata sonrası kendi kendine toparlanmanın maliyetten daha önemli olduğu görevler için.
  • İkisini birlikte kullanın: Flash'ı ilk deneme, yönlendirme ve rutin adımlarda; Pro'yu belirsiz, kritik veya son doğrulama gerektiren adımlarda çalıştırın. Bu model yönlendirme yaklaşımı, yerel LLM dağıtımı ve maliyet planlaması yazısındaki toplam sahip olma maliyeti hesabıyla birlikte düşünülmeli.

Yerel çalıştırma tarafında ağırlıklar Hugging Face ve ModelScope üzerinden açıklandı. Ancak "açık ağırlık" ifadesi, küçük bir GPU ile çalışır anlamına gelmiyor. Pro model kartı 524B dosya boyutu sınıfını, Flash kartı 159B sınıfını gösteriyor. SGLang dağıtım örneği Pro için çoklu GPU ve uzman paralelliği, Flash için daha küçük ama yine de ciddi bir GPU kümesi öneriyor. API, çoğu ekip için ilk deneme yoludur. Donanım, enerji, operasyon ve quantization maliyetini hesaplamadan self-host kararına gitmeyin.

Açık kaynak ve üretim riskleri

Xiaomi, V2.6 ile ağırlıkların yanında teknik raporu, RL kodunu, eğitim ortamlarını ve 7 binden fazla görev ortamını açık kaynak olarak yayımladığını söylüyor. Bu, araştırmacılar için önemli bir değişim. Modeli yalnızca API üzerinden tüketmek yerine eğitim fikrini, ödül tasarımını ve ajan harness'larını incelemek mümkün hale geliyor.[Xiaomi MiMo Hugging Face kuruluşu]

Yine de sonuçları bağımsız olarak doğrulamak gerekiyor. Xiaomi'nin resmi benchmark tablolarında kendi iç testleri de var. Teknik raporun ekinde SWE-Bench görsellerindeki ground-truth commit temizleme hatasına ve reward hacking riskine ayrıca değiniliyor. Bu açıklık olumlu, fakat değerlendirme ortamının sürümünü, araç izinlerini, test setinin sızıntı riskini ve başarısız görevin nasıl sayıldığını üretimde ayrıca belgelemek gerekir.

Topluluk kaynakları da aynı ihtiyatı destekliyor. BenchLM karşılaştırması, iki model için ortak ve güvenilir bir kalite sıralaması yapacak kadar bağımsız veri olmadığını açıkça belirtiyor. LLM Stats, Pro'nun bazı puanlarını sağlayıcı tarafından bildirilen, bağımsız doğrulanmamış skorlar olarak işaretliyor. Bu nedenle en sağlıklı yöntem, kendi görevlerinizden oluşan küçük bir değerlendirme seti kurmak ve fiyat, başarı, gecikme, tekrar sayısı ve insan müdahalesini birlikte ölçmek.

MiMo-V2.6-Pro ile malzeme araştırması kullanım örneği

Kaynak: MiMo-V2.6-Pro model sayfası.

Sonuç: en iyi model değil, doğru dağılım

MiMo-V2.6 Pro ve Flash, Xiaomi'nin açık ağırlık stratejisini daha ileri taşıyor. Pro, 46,32 Artificial Analysis Intelligence Index skoru, 1 milyon token bağlamı ve güçlü ajan benchmarklarıyla üst seviye açık modeller arasındaki farkı daraltıyor. Flash ise aynı multimodal temel, 1 milyon token bağlam ve daha düşük token fiyatıyla yüksek hacimli kullanım için daha çekici görünüyor.

Benchmark tablosu iki gerçeği birlikte gösteriyor. Pro, Flash'ın önünde olsa da her testte lider değil. Flash, daha küçük etkin hesap bütçesiyle bazı alanlarda Pro'yu yakalıyor, CyberGym gibi bir testte geçiyor. Bu nedenle seçim, modelin toplam parametresine bakılarak yapılmamalı. İş akışınızı ölçün, cache kullanımını tasarlayın, kritik görevlerde ikinci doğrulama ekleyin ve gerçek maliyeti tekrarlarla birlikte hesaplayın.

Başlangıç için Flash ile küçük bir üretim denemesi, Pro ile de aynı görevlerin seçilmiş bir kalite kontrol koşusu yapılabilir. Sonuçları kendi veri setinizle karşılaştırdığınızda hangi modelin size zaman ve para kazandırdığı ortaya çıkar. Siz MiMo-V2.6'yı kodlama, araştırma veya çoklu ajan akışında denediyseniz deneyiminizi paylaşın. Açık modellerin geleceğini belirleyecek ölçüt, yalnızca puan tablosu değil, doğrulanabilir üretim sonucudur.

Kaynaklar

  1. Xiaomi, Introducing the MiMo-V2.6 series
  2. Xiaomi MiMo Docs, Scaling Up Reinforcement Learning
  3. Hugging Face, MiMo-V2.6-Pro-RL model card
  4. Hugging Face, MiMo-V2.6-Flash-RL model card
  5. Xiaomi GitHub, MiMo-V2-Flash repository
  6. arXiv, MiMo-V2-Flash Technical Report
  7. Xiaomi MiMo API Pricing
  8. Xiaomi MiMo-V2.6-Pro model page
  9. Xiaomi MiMo-V2.6-Flash model page
  10. Artificial Analysis, Pro provider benchmarks
  11. OpenRouter, MiMo-V2.6-Pro
  12. OpenRouter, MiMo-V2.6-Flash
  13. n8n AI Benchmark, MiMo-V2-Flash
  14. TechNode, Xiaomi's live RL dashboard
  15. LLM Stats, MiMo-V2-Pro scorecard
  16. BenchLM, Flash versus Pro comparison
  17. PricePerToken, MiMo V2 Flash pricing
  18. Medium, technical review of MiMo-V2-Flash
  19. Hacker News discussion of the MiMo-V2.6 RL dashboard
  20. Xiaomi, Introducing MiMo-V2-Flash

Yazar

Efe Özkan

Efe Özkan

Yapay Zeka ve Yazılım Geliştirici