← Blog'a dön

Kimi K3 Çıktı: Açık Kaynak Artık "Bir Adım Geride" Değil

Moonshot AI, 2.8 trilyon parametreli Kimi K3'ü yayınladı. 896 experten 16'sını aktive eden MoE mimarisi, Kimi Delta Attention ve 1 milyon token bağlam penceresiyle gelen model; Frontend Code Arena'da 1 numara, Next.js evals'te Fable 5 ile zirveyi paylaşıyor. Açık ağırlıklar 27 Temmuz'da.

Kimi K3 Çıktı: Açık Kaynak Artık "Bir Adım Geride" Değil

Kimi K3: 2.8 Trilyon Parametreli Açık Ağırlıklı Modelle Frontier'a Yeni Giriş

Kapalı modellerin sunduğu frontier seviyesi performansı kendi altyapında, kendi kontrolünde çalıştırmak. Bugüne kadar bu iki dünya arasında net bir duvar vardı: bir tarafta Fable 5, GPT-5.6 Sol gibi kapalı devler, diğer tarafta açık ağırlıklı ama hep bir adım geriden gelen alternatifler. Moonshot AI'nin 17 Temmuz 2026'da yayınladığı Kimi K3, bu duvarı ilk kez ciddi biçimde zorluyor. 2.8 trilyon parametre, 1 milyon token bağlam penceresi ve 27 Temmuz'da yayınlanacak açık ağırlıklarıyla K3, "açık model" kavramının sınırlarını yeniden tanımlıyor.

Bu yazıda K3'ün mimarisini, benchmark performansını, gerçek dünya senaryolarındaki yeteneklerini ve fiyatlandırma stratejisini masaya yatırıyoruz. Kapalı frontier modellerle arasındaki farkı, nerede kazandığını ve nerede hala geride olduğunu somut verilerle ele alıyoruz.

Kimlik Kartı: Kimi K3 Nedir?

Kimi K3, Çin merkezli Moonshot AI'nin bugüne kadarki en büyük modeli. Şirketin K2 serisiyle (K2.5, K2.6, K2.7 Code) başlattığı açık ağırlık stratejisinin zirve noktası. İşte teknik künye:

  • Toplam parametre: 2.8 trilyon (896 expert, token başına 16'sı aktif)
  • Aktif parametre: ~50 milyar (her token için)
  • Bağlam penceresi: 1.048.576 token (native, ek ücret yok)
  • Modalite: Native multimodal (metin + görüntü + video girişi)
  • Mimari yenilikler: Kimi Delta Attention (KDA), Attention Residuals (AttnRes), Stable LatentMoE
  • Düşünme modu: Varsayılan olarak maksimum reasoning, düşük efor modları yolda
  • Çıkış tarihi: 17 Temmuz 2026 (API + ürünler), 27 Temmuz 2026 (açık ağırlıklar)
  • Fiyat: $3/M giriş, $15/M çıkış, $0.30/M cache-hit

K3, "ilk açık 3T sınıfı model" iddiasıyla geliyor. Bu iddianın altı sağlam: K2'den bu yana Moonshot, son 12 ayın 9'unda açık modeller arasında parametre üst sınırını belirledi. K3 ise sadece parametre sayısıyla değil, bu parametreleri verimli kullanma biçimiyle farklılaşıyor. Mimari detaylara girmeden önce altını çizmek gereken nokta şu: 2.8T parametrenin sadece 16/896'sı her token için aktif. Yani aldığınız kapasite 2.8T, ödediğiniz hesap ~50B. Bu oran, modelin ekonomisini baştan aşağı belirliyor.

Kimi K3 showcase - model overview

Mimarinin Kalbi: Kimi Delta Attention (KDA)

K3'ün en kritik mimari kararı, dikkat mekanizmasında yatıyor. Standart transformer modellerde her token, kendinden önceki tüm token'lara bakar. Bu "tam dikkat" mekanizması 1 milyon token bağlamda devasa bir KV cache belleği gerektiriyor ve her yeni token üretimi giderek yavaşlıyor. K3 bu sorunu Kimi Delta Attention (KDA) ile çözüyor.

Lineer Dikkat ve Delta Kuralı

KDA'nın temelinde lineer dikkat (linear attention) yatıyor. Klasik dikkatin aksine, lineer dikkat büyüyen bir KV cache yerine sabit boyutlu bir durum matrisi tutuyor. Her gelen token bu matrisi güncelliyor, tıpkı sürekli güncellenen bir özet gibi. Ancak naif lineer dikkatin bir zaafı var: sabit boyutlu bir durum, yeni bilgi yazmak için eski bilgiyi silmek zorunda. İşte burada delta kuralı devreye giriyor.

Delta kuralı şöyle çalışıyor: Model, mevcut durumunun gelen token için ne tahmin ettiğine bakar. Eğer tahmin doğruysa neredeyse hiçbir şey yazmaz (kapasite israfı olmaz). Tahmin yanlışsa, sadece hatanın kendisini duruma yazar. Bu, gradyan inişinin forward pass içinde, her token için bir kez çalışması gibi düşünülebilir. KDA'nın asıl katkısı ise bu süreci kanal bazında (per-channel) kontrol etmesi. Her özellik boyutu bağımsız olarak ne kadar unutacağına karar verebiliyor. Bazı boyutlar bir gerçeği milyon token boyunca tutarken, diğerleri birkaç token'da bir yenileniyor. Tek bir skalar gate'in ifade edemeyeceği bu ince taneli bellek yönetimi, KDA'nın uzun mesafeli hatırlamada lineer dikkatin tipik unutkanlığını aşmasını sağlıyor.

KDA + Gated MLA Hibriti

K3 tamamen lineer değil. Moonshot, KDA katmanları arasına periyodik olarak Gated MLA (Multi-head Latent Attention) katmanları yerleştirmiş. Bu katmanlar, lineer durumun kaybettiği "tam isabet" gerektiren bakışları yapıyor: "40.000. satırdaki değişkenin adı neydi", "şu cümleyi kelimesi kelimesine alıntıla" gibi. KDA katmanları ile Gated MLA katmanları arasındaki oran yaklaşık 3:1, yani katmanların dörtte üçü lineer (ucuz), dörtte biri tam dikkat (pahalı ama gerekli).

Attention Residuals (AttnRes)

K3'ün ikinci büyük yeniliği. Derin transformer modellerinde katman sayısı arttıkça bilgi akışı zayıflar; her katman bir öncekinin çıktısına körü körüne ekleme yapar. AttnRes bunu değiştiriyor: her katman, önceki katmanların temsiline seçici olarak erişebiliyor. Hangi derinlikten ne kadar sinyal alacağına kendisi karar veriyor. Moonshot'a göre bu, eğitim verimliliğini yaklaşık %25 artırırken ek maliyeti %2'nin altında tutuyor. Bu, "daha derin model = daha iyi model" denklemini daha verimli hale getiren bir numara.

Stable LatentMoE: 896 Expert, 16 Aktif

K3'ün MoE tasarımı da agresif. 896 expert'in sadece 16'sı her token için aktif. Bu seyrekliği stabil tutmak için iki kritik bileşen var:

  • Quantile Balancing: Router skorlarının dağılımına (kantillerine) göre uzman yük dengelemesi. Klasik MoE modellerinde birkaç popüler expert tüm trafiği çeker, diğerleri körelir. Kantil bazlı dengeleme, router'ın gerçek tercihlerini bozmadan trafiği yayıyor.
  • SiTU (Sigmoid Tanh Unit): Bilgi akışını daha ince kontrol eden, K3 için özel geliştirilmiş bir aktivasyon fonksiyonu. 2.8T ölçeğinde router'ın osile etmeden eğitilebilmesinin arkasındaki stabilite hikayesi.

Bu üç yenilik (KDA + AttnRes + Stable LatentMoE) bir araya geldiğinde, Moonshot K2'ye kıyasla yaklaşık 2.5 kat ölçekleme verimliliği elde ettiklerini söylüyor. Compute'u zekaya çevirme oranı ciddi biçimde iyileşmiş.

Kimi K3 architecture - KDA, Stable LatentMoE, and Attention Residuals

Benchmark'lar: Frontier'a Kafa Kafaya

K3'ün benchmark tablosu iddialı. Moonshot'ın kendi değerlendirme setinde model, Claude Opus 4.8 ve GPT-5.5'i çoğu ajansal testte geçiyor, Claude Fable 5 ve GPT-5.6 Sol ile ise birçok kategoride yarışıyor. Ama satıcı benchmark'larına her zamanki mesafeyle yaklaşmakta fayda var. Asıl çarpıcı olan, bağımsız platformlardan gelen sonuçlar:

Next.js Evals (Vercel)

Next.js AI Agent Evaluations, web mühendisliği için en kapsamlı açık benchmark'lardan biri. 9 Temmuz 2026 itibarıyla K3, %92 başarı oranıyla Fable 5 ve Cursor Composer 2.5 ile zirveyi paylaşıyor. AGENTS.md dokümantasyonu eklendiğinde bu oran %96'ya çıkıyor. Süre avantajı da K3'ten yana: 199.89 saniye, Fable 5'in 233.93 saniyesine karşı. Açık bir modelin tüm kapalı rakipleriyle aynı seviyeye gelmesi, bu benchmark'ın tarihinde bir ilk.

Frontend Code Arena

Daha da etkileyici olan Arena sonuçları. K3, Frontend Code Arena'da 1.679 puanla 1 numara. K2.6'nın 18. sırasından zirveye sıçraması 17 basamaklık bir atlayış. 7 frontend kategorisinin 6'sında lider (Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations, Content Creation Tools), sadece Gaming'de Fable 5'in arkasında. Kazanma oranı %76; Fable 5'in %63 ve GPT-5.6 Sol'un %58'inin belirgin biçimde üzerinde.

Artificial Analysis Intelligence Index

Bağımsız değerlendirme platformu Artificial Analysis, K3'e 57.1 Intelligence Index puanı verdi. Bu skor Opus 4.8 (56) ve GPT-5.5 ile aynı ligde, Fable 5 (60) ve GPT-5.6 Sol'un (59) ise gerisinde. 189 model arasında 4. sırada. Coding Index'te 76.2, Agentic Index'te 50.1 ile ilk %3'lük dilimde. Intelligence Index görev başına maliyet ise $0.94; GPT-5.6 Sol'un $1.04 ve Fable 5'in $2.75'inin altında.

Satıcı Benchmark'larına Dürüst Bakış

Moonshot'ın kendi benchmark tablosunda K3; Program Bench, SWE Marathon, BrowseComp, SpreadsheetBench 2 ve Automation Bench'te tüm rakiplerini geçiyor. Ancak bu testlerde kullanılan harness'lar karışık: K3 KimiCode ve Claude Code ile, Claude modeller Claude Code ile, GPT modelleri Codex ile çalıştırılmış. Fable 5'in kullanım politikası gereği reddettiği istekler Opus 4.8'e düşüyor. Bu tür "elma-armut" karışımı, satıcı benchmark'larının klasik zaafı. Yine de DeepSWE'de KimiCode ve mini-SWE-agent harness'ları arasında sadece 0.2 puan fark olması (67.5 vs 67.3), en azından bazı testlerde harness etkisinin sınırlı olduğunu gösteriyor.

Kimi K3 benchmark comparison against frontier models

Gerçek Dünya Senaryoları: Benchmark'ın Anlatmadığı

Benchmark tabloları bir şey anlatır, gerçek dünya senaryoları başka bir şey. Moonshot'ın K3 için yayınladığı vaka çalışmaları, modelin uzun ufuklu (long-horizon) ajan yeteneklerini somut biçimde ortaya koyuyor:

GPU Kernel Optimizasyonu

Modeller, birbirinin aynı sanal alanlarda 24 saat boyunca GPU kernel'lerini profilleme, yeniden yazma ve benchmark etme görevine bırakıldı. AttnRes kernel optimizasyonunda K3, 15 saat kesintisiz iterasyon sonunda ileri+geri geçiş süresini 283.6 ms'den 114.4 ms'ye indirdi. Daha da çarpıcı olan MLA-512 testi: Sıfırdan kernel yazılan bu görevde K3 517.8 TFLOPS elde etti; H200'ün teorik BF16 zirvesinin yarısından fazlası. Bir diğer GPGPU senaryosunda ise forward+backward süresini %73.6 kısalttı.

MiniTriton: Sıfırdan GPU Derleyicisi

K3'ten bir GPU programlama sistemi inşa etmesi istendi. Sonuç: MiniTriton; Triton benzeri bir DSL, MLIR üzerinde kendi tile-level IR katmanı, optimizasyon pass'leri ve PTX kod üretim pipeline'ı. NanoGPT eğitiminde referansla neredeyse birebir loss eğrisi yakalayan bu derleyici, bazı iş yüklerinde Triton ve torch.compile'ı geçiyor. Bu, izole kernel'lerin ötesinde, uçtan uca bir sistem inşa edebilme kapasitesini gösteriyor.

Oyun Geliştirme ve 3D Dünyalar

K3, Three.js WebGPU kullanarak prosedürel bir açık dünya oyunu inşa etti: ormanlar, kütük kulübeler, karlı dağlar ve dinamik hava durumu. "Vision in the loop" yaklaşımıyla kod ve canlı ekran görüntüleri arasında sürekli iterasyon yaparak görsel çıktıyı anında görüp düzeltebiliyor. Bu, frontend kodlama becerisiyle görsel muhakemeyi birleştiren hibrit bir yetenek.

Çip Tasarımı: Modelin Model için Ürettiği Çip

Belki de en çılgın demo: K3, 48 saatlik otonom bir çalışmayla, kendi mimarisini temel alan bir nano modeli çalıştırmak üzere bir çip tasarladı. Açık kaynak EDA araçları, Nangate 45nm kütüphanesi, 4 mm² alan, 100 MHz'de timing kapama, simülasyonda 8.700+ token/s çözme hızı. 1.46M standart hücre, 0.277 MB SRAM, INT4 MAC dizisi ve fused dequantization içeriyor. "Bir modelin, bir model için ürettiği çip"; uzun ufuklu ajan yeteneklerinin sınırlarını gösteren bir kavram kanıtı.

Fiyatlandırma: Açık Model, Kapalı Model Fiyatı

K3'ün fiyatlandırması, açık ağırlıklı modeller için yeni bir sayfa açıyor. $3/M giriş, $15/M çıkış; bu, Claude Sonnet 5 ile aynı fiyat etiketi. (Sonnet 5'in Ağustos 2026 sonuna kadar süren $2/$10 promosyon fiyatı sayılmazsa.) Karşılaştırmalı tablo:

  • Kimi K3: $3 giriş / $15 çıkış / $0.30 cache-hit
  • Claude Sonnet 5 (standart): $3 giriş / $15 çıkış
  • Claude Opus 4.8: $15 giriş / $75 çıkış
  • GPT-5.6 Sol: $5 giriş / $30 çıkış
  • Claude Fable 5: $10 giriş / $50 çıkış

Rakamlar net: K3, Opus 4.8'den 5 kat, Fable 5'ten 3.3 kat daha ucuz. Ama fiyat etiketi hikayenin sadece yarısı. Asıl soru: görev başına maliyet ne?

Gerçek Dünya Maliyet Hesabı

Bir frontend landing page senaryosu üzerinden gerçek bir karşılaştırma yapıldı:

  • Fable 5: 45.800 token, $0.42
  • Kimi K3: 38.200 token, $0.05

K3 aynı görevi daha az token ile tamamladı ve 8 kat daha ucuza geldi. Artificial Analysis'in verileri de bu tabloyu destekliyor: K3 Intelligence Index görev başına $0.94, Fable 5 $2.75, GPT-5.6 Sol $1.04. K3'ün tek handikapı: yüksek reasoning eforu nedeniyle output token sayısı rakiplerin neredeyse 2 katı. Yani liste fiyatı ucuz ama model "geveze"; daha fazla token üreterek tasarrufun bir kısmını geri alıyor.

Cache-hit oranı burada kritik. Moonshot'ın Mooncake split-inference mimarisi sayesinde programlama trafiğinde %90+ cache-hit elde ediliyor. Bu, efektif giriş maliyetini $3'ten ~$0.57'ye düşürüyor. Agent'larınızı stabil prefix'lerle beslerseniz, K3'ün gerçek maliyeti liste fiyatının oldukça altına inebiliyor.

Ekosistem: Kimi Code, vLLM ve Açık Ağırlık Yol Haritası

K3 sadece bir API modeli değil, bir ekosistemle geliyor. Kimi Code, terminal tabanlı bir coding agent olarak K3'ü varsayılan model yapmış durumda. Moderato planı 256K, Allegretto planı tam 1M bağlam sunuyor. Kimi Work kurumsal tarafta, Kimi Hosted Agent ise enterprise düzeyde izole sandbox ve uzun süreli çalışma ortamları vaat ediyor.

Açık kaynak tarafında en kritik gelişme: vLLM ekibi, KDA prefix caching implementasyonunun bizzat Moonshot tarafından vLLM'e katkılandığını ve day-0 desteğin hazır olduğunu duyurdu. Bu, 27 Temmuz'da ağırlıklar yayınlandığı anda inference tarafında hazır bir altyapı olacağı anlamına geliyor. Fireworks AI de K2 serisinde olduğu gibi K3 için day-zero destek sözü vermiş durumda.

27 Temmuz tarihi kritik. Şu an K3 "open-weight-committed" ama henüz "open-weight" değil. Moonshot'ın WeChat üzerinden yaptığı resmi duyuru bu tarihi teyit ediyor. Lisans koşulları ise henüz açıklanmadı; önceki Kimi modellerinde kullanılan Modified MIT lisansının devam edip etmeyeceği belirsiz.

K3'ü Nerede Kullanmalı, Nerede Kullanmamalı?

Güçlü olduğu alanlar:

  • Frontend geliştirme ve web mühendisliği: Arena ve Next.js evals liderliği bunu net biçimde gösteriyor. Landing page, UI prototipleme, 3D web deneyimleri.
  • Uzun ufuklu coding agent işleri: Kernel optimizasyonu, derleyici geliştirme, çip tasarımı gibi günler süren otonom görevler.
  • Kod + görsel hibrit işler: Oyun geliştirme, CAD, ekran görüntüsü üzerinden hata ayıklama. "Vision in the loop" burada gerçek bir fark yaratıyor.
  • Maliyet duyarlı agent deployment: Cache-hit optimizasyonuyla Fable 5'e kıyasla 3-8 kat daha ucuz görev tamamlama.

Dikkat edilmesi gereken noktalar:

  • UX boşluğu: Moonshot'ın kendi itirafıyla, K3'ün kullanıcı deneyimi Fable 5 ve GPT-5.6 Sol'un gerisinde. Cevap kalitesi, talimat takibi, edge case'lerde hala fark var.
  • Thinking history hassasiyeti: K3 preserved thinking modunda eğitildi. Eğer agent harness'ı geçmiş thinking içeriğini düzgün iletmezse veya bir oturumu başka bir modelle başlatıp K3'e geçerseniz, çıktı kalitesi ciddi biçimde düşebiliyor.
  • Aşırı proaktiflik: Uzun ufuklu görevler için optimize edildiğinden, küçük sorunlarda veya belirsiz kullanıcı niyetinde beklenmedik kararlar alabiliyor. Sıkı sınırlar gerektiren uygulamalarda sistem prompt'unda açık davranış kısıtlamaları şart.
  • Yerel çalıştırma: ~1.4TB MXFP4 ağırlık ve 64+ hızlandırıcılı supernode gereksinimi, K3'ü laptop'ta çalıştırılabilir bir model olmaktan çıkarıyor. Açık ağırlıklar araştırma lab'ları, cloud provider'lar ve fine-tuning için.

Sonuç: Açık Modeller İçin Yeni Bir Eşik

Kimi K3, açık ağırlıklı modeller ile kapalı frontier arasındaki makası şimdiye kadarki en dar noktaya çekti. Frontend Code Arena'da 1 numara, Next.js evals'te Fable 5 ile eşit, Artificial Analysis'te Opus 4.8'i geçmiş durumda. Üstelik tüm bunları Sonnet 5 fiyatına, Fable 5'in 3'te 1'i maliyetle yapıyor.

Ancak bu bir "Fable 5 katili" hikayesi değil. Moonshot'ın kendi itiraf ettiği UX boşluğu, thinking history hassasiyeti ve aşırı proaktiflik, K3'ün hala olgunlaşmakta olduğunu gösteriyor. Asıl hikaye şu: 27 Temmuz'da ağırlıklar yayınlandığında, frontier seviyesine bu kadar yakın bir modeli kendi altyapınızda çalıştırabilecek, fine-tune edebilecek ve dağıtabilecek olmanız. Bu, kapalı API ekonomisinin temel varsayımlarını sarsan bir gelişme.

Daha önce Kimi K2.6'nın açık kaynak coding'te yarattığı etkiyi ve MiniMax M3'ün açık ağırlık stratejisini ele almıştık. K3, bu iki hikayenin kesişim noktasında duruyor: hem K2 serisinin coding odaklı yaklaşımını zirveye taşıyor, hem de M3 gibi "açık ama ucuz değil" paradigmasını benimsiyor. SLM dünyasındaki gelişmelerle birlikte okunduğunda, 2026'nın açık model ekosistemi için tarihi bir yaz olduğu net.

27 Temmuz'u bekleyin. O tarihte yayınlanacak teknik rapor ve açık ağırlıklar, bu değerlendirmenin ne kadarının ayakta kaldığını gösterecek. Şimdilik söyleyebileceğimiz şu: kapalı frontier modellerin alternatifsiz olmadığı bir döneme girdik. Ve bu dönemin kapısını, 896 expert'inden sadece 16'sını uyandıran 2.8 trilyon parametreli bir model araladı.


Bu yazıdaki benchmark verileri ve teknik detaylar Moonshot AI resmi blogu, Artificial Analysis, Vercel Next.js Evals ve Arena AI Frontend Code Leaderboard kaynaklarından derlenmiştir.

Efe Hüseyin Özkan

Yazılım Mühendisi & AI Geliştirici

Yapay zeka sistemleri, full-stack geliştirme ve ölçeklenebilir ürün mimarisi üzerine çalışıyor. Daha fazla teknik yazı için blogu takip edebilirsiniz.