Kendi Ekran Kartımı Kullanarak Kendi Yapay Zeka Uygulamamı Geliştirebilir Miyim?

Evet, kendi ekran kartınızla kendi yapay zeka uygulamanızı geliştirebilirsiniz. Yerel bir dil modelini çalıştırıp onu kendi kodunuzdan çağırmak, belgelerinizle konuşan bir asistan (RAG) kurmak, Stable Diffusion benzeri modellerle görüntü üretmek ve küçük modellere LoRA ile ince ayar yapmak orta seviye bir kartla bile mümkündür. Sınırı çoğunlukla işlemci gücü değil, kartın video belleği (VRAM) belirler.
Hızlı sıra şudur: (1) Kartınızın markasını ve VRAM miktarını öğrenin; (2) Ollama veya LM Studio kurup 7-8 milyar parametrelik küçük bir model deneyin; (3) Modelin yerel API'sine basit bir betikle bağlanın; (4) Belgeleriniz için RAG ekleyin; (5) Görüntü üretimi ve ince ayarı ancak bunlar oturduktan sonra deneyin; (6) Ticari bir ürün düşünüyorsanız model lisansını okuyun.
Kısa Cevap: Ne Kadarı Mümkün, Ne Kadarı Değil?
Evdeki bir ekran kartı, dev bulut modellerinin yerini tutmaz ama gerçek ve kullanışlı uygulamalar için fazlasıyla yeterlidir. Pratikte şunlar rahatça yapılabilir: günlük sohbet ve yazı asistanı, metin özetleme, sınıflandırma, bilgi çıkarma, kod yardımcısı, kendi PDF ve notlarınızda arama yapan bir asistan, görsel üretimi ve küçük veri setleriyle ince ayar. Şunlar ise genellikle zordur: çok büyük modelleri (onlarca milyar parametre üstü) akıcı hızda çalıştırmak, sıfırdan model eğitmek ve aynı anda yüzlerce kullanıcıya hizmet vermek.
Önemli bir ayrım yapmakta fayda var. "Yapay zeka uygulaması geliştirmek" ile "yapay zeka modeli eğitmek" aynı şey değildir. Uygulama geliştirmek çoğu zaman hazır, açık bir modeli kendi yazılımınıza bağlamaktır. Bu iş için güçlü bir ekran kartı gerekmez; model yerelde çalışıyorsa bile uygulamanın geri kalanı sıradan bir web veya masaüstü yazılımıdır. Model eğitmek ise çok daha fazla bellek, zaman ve veri ister. Bu yazıda ağırlığı uygulama tarafına vereceğiz, ince ayarın neye yettiğini ayrı bir bölümde ele alacağız.
| İş | Evdeki kartla mümkün mü? | Not |
|---|---|---|
| Yerel sohbet modeli çalıştırmak | Evet | Küçük ve orta modeller rahat çalışır |
| Kendi belgelerinizle RAG asistanı | Evet | Küçük bir model ve gömme (embedding) modeli yeter |
| Görüntü üretimi (Stable Diffusion) | Evet | Model sürümüne göre VRAM ihtiyacı değişir |
| LoRA / QLoRA ince ayar | Küçük modellerde evet | Bellek ihtiyacı model ve ayarlara bağlıdır |
| Sıfırdan büyük model eğitmek | Hayır | Küme ve ciddi bütçe gerektirir |
| Çok kullanıcılı canlı servis | Sınırlı | Tek kullanıcı veya küçük ekip için uygundur |
VRAM Neden Bu Kadar Önemli?
Bir yapay zeka modeli, çalışırken bütün ağırlıklarını hızlı erişilebilir bellekte tutmak ister. Ekran kartında bu bellek VRAM'dir. Model VRAM'e tamamen sığarsa kartın hızlı belleği ve hesaplama birimleri tam verimle kullanılır. Sığmazsa bir kısmı sistem belleğine (RAM) taşınır ve işlemci devreye girer; bu durumda üretim hızı belirgin biçimde düşer. Ollama gibi araçlar bunu otomatik yapar, yani model "çalışır" ama yavaşlar. Yaygın pratik gözlem, kısmi yüklemede hızın birkaç kat, hatta çok daha fazla düştüğüdür; kesin çarpan donanıma ve modele göre değişir.
Bu yüzden ekran kartı seçerken ya da mevcut kartınızı değerlendirirken çekirdek sayısından önce VRAM miktarına bakın. Aynı nesilde 8 GB'lık bir kart ile 16 GB'lık bir kart arasındaki fark, çalıştırabileceğiniz model sınıfını değiştirir. Hesaplama gücü ise modelin ne kadar hızlı yanıt üreteceğini belirler; yani VRAM "çalışır mı?" sorusunu, hesaplama gücü "ne kadar akıcı?" sorusunu cevaplar.
VRAM yalnızca model ağırlıklarına gitmez. Bağlam penceresi (modelin aynı anda hatırladığı metin miktarı) için ayrılan önbellek (KV cache), uzadıkça bellek tüketir. Ayrıca sürücü, işletim sistemi ve ekranı çizen programlar da VRAM kullanır. Bu yüzden "model dosyası 6 GB, kartım 8 GB, sığar" hesabı çoğu zaman sınırda kalır; kendinize pay bırakın.
Model Boyutu ve Kuantizasyon İlişkisi
Modeller parametre sayısıyla anılır: 3B, 7B, 8B, 14B, 32B, 70B gibi (B = milyar). Her parametre bellekte belli bir sayıda bayt tutar. Tam hassasiyette (FP16) bir parametre yaklaşık 2 bayt eder; yani 7B bir model kabaca 14 GB tutar. Kuantizasyon, ağırlıkları daha az bitle saklayarak boyutu küçültür. 4 bit civarında bir kuantizasyonda parametre başına yaklaşık yarım bayt gerekir; yani 7B model kabaca 4 ila 5 GB'a iner. Ollama'nın kütüphanesindeki birçok model varsayılan olarak 4 bit civarı bir kuantizasyonla gelir.
Aşağıdaki tablo yalnızca kabaca bir kuraldır. Gerçek değerler model mimarisine, kuantizasyon türüne, bağlam uzunluğuna ve kullandığınız araca göre değişir; kesin rakam olarak okumayın.
| Model boyutu | FP16 (kabaca) | 8 bit (kabaca) | 4 bit (kabaca) |
|---|---|---|---|
| 3B | 6 GB | 3-4 GB | 2-3 GB |
| 7B - 8B | 14-16 GB | 7-9 GB | 4-6 GB |
| 14B | 28 GB | 14-16 GB | 8-10 GB |
| 32B | 64 GB | 32-35 GB | 18-22 GB |
| 70B | 140 GB | 70-75 GB | 38-45 GB |
Bu rakamlara bağlam önbelleği ve çalışma payı eklenir. Pratik kural: model dosyasının boyutuna biraz pay ekleyin ve toplamın VRAM'inizin altında kaldığından emin olun. Kuantizasyonun bir bedeli vardır: bit sayısı düştükçe kalite bir miktar azalır. 4 bit civarı çoğu günlük iş için kabul edilebilir bir denge sayılır; çok düşük bitlerde (2-3 bit) kalite kaybı daha görünür hale gelir. Hangi seviyenin sizin işiniz için yeterli olduğunu denemeden bilemezsiniz, bu yüzden aynı modelin iki farklı kuantizasyonunu kendi örnek sorularınızla karşılaştırmak iyi bir alışkanlıktır.
Bir de "uzman karışımı" (MoE) modeller vardır. Bunlar toplamda büyük olsa da her adımda parametrelerinin yalnızca bir bölümünü kullanır. Hız avantajı sağlayabilirler ama bütün ağırlıkların yine bellekte durması gerektiği için VRAM ihtiyacı toplam boyuta göre belirlenir. Model sayfasındaki boyut bilgisine bakmak en güvenlisidir.
Yerelde Model Çalıştırma Araçları: Ollama, LM Studio, llama.cpp
Modeli kendiniz yüklemeniz, derlemeniz ya da ayarlamanız gerekmez; bu işi yapan olgun araçlar var. Üçü de açık veya ücretsiz biçimde kullanılabilir ve birbirine yakın bir çekirdeği paylaşır.
| Araç | Kime uygun? | Güçlü yanı | Dikkat edilecek nokta |
|---|---|---|---|
| Ollama | Geliştiriciler, hızlı başlangıç | Tek komutla model indirme ve çalıştırma, yerel API sunar | Ayrıntılı ayar için model dosyası (Modelfile) bilmek gerekebilir |
| LM Studio | Kod yazmadan denemek isteyenler | Görsel arayüz, model arama ve indirme, yerel sunucu modu | Arayüz uygulaması; sunucuya göre daha az otomasyon dostu olabilir |
| llama.cpp | İnce kontrol isteyenler | Çok çeşitli donanımda çalışır, GGUF biçimi, birçok aracın temeli | Derleme ve komut satırı bayrakları öğrenme eğrisi ister |
Başlangıç için en kolay yol genellikle Ollama veya LM Studio'dur. Ollama'yı kurduktan sonra komut satırından bir modeli indirip çalıştırabilirsiniz; arka planda bir yerel sunucu açılır ve uygulamanız bu sunucuya HTTP isteği atar. llama.cpp ise bu araçların birçoğunun altında yatan motordur; özel bir senaryonuz varsa (belirli donanım, belirli bayraklar, GGUF dönüştürme) doğrudan kullanmak isteyebilirsiniz. Her aracın kurulum adımları sürüme göre değişebilir; güncel komutlar için kendi resmi belgelerine bakın.
Modeller çoğunlukla GGUF adlı bir dosya biçiminde dağıtılır. Dosya adında Q4_K_M, Q5_K_M, Q8_0 gibi ekler görürsünüz; bunlar kuantizasyon türünü gösterir. Sayı yaklaşık bit düzeyidir, harfler ise yöntemin ayrıntısıdır. Emin değilseniz araçların önerdiği varsayılan sürümle başlayın.
Uygulama Geliştirme Akışı: Yerel API Üzerinden Basit Bir Uygulama
Yerel model çalıştığında asıl iş başlar: onu kendi yazılımınızın parçası yapmak. Akış genellikle şöyledir. Önce modeli arka planda çalışan bir yerel sunucu olarak açarsınız. Sonra uygulamanız bu sunucuya bir istek gönderir; istek içinde konuşma mesajları ve model adı bulunur. Sunucu cevabı üretir, uygulamanız bunu ekrana basar ya da bir sonraki adımda kullanır. Ollama'nın kendi API'si olduğu gibi, birçok yerel sunucu OpenAI uyumlu bir uç nokta da sunar; bu sayede aynı kodu değiştirmeden yerel ve bulut modeller arasında geçiş yapabilirsiniz. Uyumluluğun kapsamı sürüme göre değiştiği için kullandığınız aracın belgesini kontrol edin.
Basit bir uygulama için tipik parçalar şunlardır: bir ön yüz (web sayfası ya da masaüstü pencere), modelle konuşan küçük bir arka uç (Python veya JavaScript), sistem talimatı (modelin rolünü ve üslubunu belirleyen metin) ve konuşma geçmişi. İlk sürümde bunların hepsi tek bir dosyada olabilir. Ön yüzü hazırlarken sıradan web bileşenleriyle uğraşırsınız; bu konuda takıldığınız yerler için iframe sorunları gibi sıradan web konularını da hatırlatmak isteriz: yapay zeka uygulamanızı bir sayfaya gömmeyi düşünüyorsanız bu tür ayrıntılar karşınıza çıkacaktır.
Üretim hızını kullanıcıya hissettirmek için yanıtı akış (streaming) olarak göstermek iyi bir alışkanlıktır. Model kelimeleri üretirken ekrana düşürürseniz, toplam süre aynı olsa bile uygulama daha hızlı hissedilir. Ayrıca zaman aşımı, hata mesajı ve "model yükleniyor" durumu gibi uç durumları baştan düşünün; yerel modelin ilk istekte belleğe yüklenmesi birkaç saniye sürebilir.
Güvenlik tarafında bir uyarı: yerel sunucuyu varsayılan olarak yalnızca kendi bilgisayarınızdan erişilebilir bırakın. Onu ağa ya da internete açmak istiyorsanız kimlik doğrulama ve ters vekil (reverse proxy) gibi önlemler gerekir. Uygulamanız kullanıcıdan gelen metni modele aktarıyorsa, kötü niyetli girdilerin modelin talimatını bozmaya çalışabileceğini (prompt injection) de hesaba katın. Uygulamanızın güvenliğini bağımsız biçimde sınatmak isterseniz sızma testi yazımız bu sürecin ne olduğunu özetliyor.
Kendi Belgelerinizle Konuşan Uygulama: RAG
RAG (Retrieval-Augmented Generation), modeli yeniden eğitmeden onun kendi belgelerinizden bilgi kullanmasını sağlayan yöntemdir. Çoğu "kendi verimle çalışan yapay zeka" ihtiyacı için ince ayardan daha uygun, daha ucuz ve daha kolay güncellenir bir çözümdür. Mantığı basittir: belgelerinizi parçalara bölersiniz, her parçayı bir gömme (embedding) modeliyle sayısal bir vektöre çevirirsiniz, vektörleri bir veri tabanında saklarsınız. Kullanıcı soru sorduğunda sorunun da vektörü çıkarılır, en yakın parçalar bulunur ve bu parçalar soruyla birlikte modele verilir. Model cevabı bu metinlere dayanarak yazar.
| Adım | Ne yapılır? | Dikkat |
|---|---|---|
| 1. Belge hazırlama | PDF, not, sayfa metnini temiz metne çevirmek | Tablolar ve taranmış belgeler ek iş gerektirir |
| 2. Parçalama | Metni anlamlı bölümlere ayırmak | Çok küçük parça bağlamı kaybettirir, çok büyük parça gürültü katar |
| 3. Gömme | Parçaları vektöre çevirmek | Türkçe için çok dilli bir gömme modeli seçin |
| 4. Saklama | Vektör veri tabanına yazmak | Küçük projede basit yerel çözümler yeter |
| 5. Arama ve cevap | İlgili parçaları bulup modele vermek | Cevaba kaynak göstermek güveni artırır |
RAG'in en büyük avantajı güncellemedir: belgeleriniz değiştiğinde modeli değil yalnızca arama dizinini yenilersiniz. Dezavantajı, cevabın kalitesinin arama kalitesine bağlı olmasıdır. Yanlış parçalar bulunursa model yanlış cevap verir. Bu yüzden önce küçük bir deneme seti hazırlayın: yirmi otuz gerçek soru ve beklenen cevaplar. Her değişiklikten sonra bu soruları yeniden sorup sonuçları karşılaştırın.
Gömme modelleri genellikle küçüktür ve düşük VRAM'le, hatta işlemciyle bile çalışır. Asıl bellek yükü sohbet modelindedir. Bağlama çok fazla parça koymak hem hızı düşürür hem de VRAM tüketimini artırır; bu yüzden en ilgili birkaç parçayı seçmek genellikle hepsini vermekten daha iyidir.
Görüntü Üretimi: Stable Diffusion ve Benzerleri
Metinden görüntü üreten difüzyon modelleri de yerelde çalışabilir. Stable Diffusion ailesi ve benzeri açık modeller için ComfyUI, AUTOMATIC1111 tabanlı arayüzler ya da Hugging Face Diffusers kütüphanesi gibi araçlar kullanılır. Burada da belirleyici faktör VRAM'dir: model sürümü büyüdükçe ve üretilen görüntünün çözünürlüğü arttıkça bellek ihtiyacı artar. Daha yeni ve büyük modeller daha fazla bellek ister; eski ve küçük sürümler daha mütevazı kartlarda çalışır. Kesin rakam için seçtiğiniz modelin ve arayüzün belgesine bakın.
Düşük VRAM'li kartlarda yardımcı olan teknikler vardır: yarı hassasiyette (FP16) çalışmak, kuantize edilmiş model sürümleri kullanmak, bazı katmanları geçici olarak RAM'e almak (offload) ve çözünürlüğü düşük başlatıp sonradan büyütmek. Bunlar hızı biraz düşürebilir ama kartınızı çalışır hale getirir. Görüntü üretimini bir uygulamaya bağlamak istiyorsanız ComfyUI ve benzeri araçların API sunduğunu görürsünüz; yani yerel dil modelinde yaptığınız gibi bir istek atıp görüntü alabilirsiniz.
Telif ve içerik konusunda dikkatli olun. Modelin lisansı ticari kullanıma izin vermeyebilir, ayrıca üretilen görüntülerde kişilerin görüntü hakları ve marka içerikleri gibi hukuki konular ortaya çıkabilir. Ticari kullanım bölümünde bunu ayrıca ele alıyoruz.
İnce Ayar (LoRA ve QLoRA) Neye Yeter?
İnce ayar, hazır bir modelin davranışını kendi örneklerinizle biraz değiştirmektir. Tam ince ayar bütün parametreleri günceller ve çok bellek ister. LoRA ise orijinal ağırlıkları dondurup yalnızca küçük, eklenen "adaptör" katmanlarını eğitir; bellek ve zaman ihtiyacı belirgin biçimde azalır. QLoRA bir adım ileri gider: temel modeli 4 bit kuantize edilmiş halde tutar, adaptörleri daha yüksek hassasiyette eğitir. QLoRA makalesi bu yöntemle 65B parametreli bir modelin tek 48 GB'lık kartta ince ayarının yapılabildiğini bildirir; bu, yöntemin tavanını gösteren bir örnektir, evdeki kart için hedef değildir.
| Yöntem | Ne eğitilir? | Bellek ihtiyacı | Evdeki kart için uygunluk |
|---|---|---|---|
| Tam ince ayar | Tüm parametreler | Çok yüksek (ağırlık, gradyan, optimizer durumu) | Yalnızca çok küçük modellerde |
| LoRA | Küçük adaptörler | Orta; temel model genelde 16 bit tutulur | Küçük ve orta modellerde |
| QLoRA | Adaptörler, temel model 4 bit | En düşük | Orta seviye kartlarda küçük modeller için en gerçekçi yol |
Ev tipi kartlarla gerçekçi hedef şudur: 7-8B sınıfı bir modele, belirli bir üslup, biçim ya da dar bir görev için QLoRA ile adaptör eğitmek. Veri seti küçük olabilir ama kaliteli olmalıdır; yüzlerce ila birkaç bin temiz örnek çoğu dar görev için bir başlangıçtır, ancak kesin sayı göreve bağlıdır. Eğitim sırasında bellek, parti boyutu (batch size), dizi uzunluğu ve gradyan biriktirme ayarlarına duyarlıdır; VRAM yetmezse bunları düşürürsünüz.
İnce ayarın ne yapmadığını da bilin: modelin bilgi dağarcığını güvenilir biçimde genişletmez. Şirketinizin belgelerinden cevap verilmesini istiyorsanız önce RAG'i deneyin. İnce ayarı üslup, çıktı biçimi, belirli bir sınıflandırma ya da ton gibi davranış değişiklikleri için düşünün. Eğitim araçları olarak Hugging Face Transformers, PEFT, TRL ve bitsandbytes kütüphaneleri sık kullanılır; Unsloth gibi bellek dostu araçlar da vardır. Hangisini seçerseniz seçin, sürüm uyumluluğuna dikkat edin, çünkü bu kütüphaneler hızlı değişiyor.
NVIDIA, AMD ve Apple Silicon Farkı
Yapay zeka araçlarının büyük kısmı önce NVIDIA'nın CUDA platformu için yazıldı. Bu yüzden NVIDIA kartlarda destek en geniş, belge ve topluluk yardımı en bol olandır. PyTorch, bitsandbytes ve ince ayar araçlarının birçok özelliği CUDA ile en sorunsuz çalışır. Yeni bir aracı denerken "NVIDIA'da çalışıyor mu?" sorusu çoğu zaman olumlu cevaplanır.
AMD kartlar ROCm yığınıyla desteklenir. Ollama ve llama.cpp belirli AMD kartlarını destekler; ancak destek listesi karta, sürücüye ve işletim sistemine göre değişir. Linux'ta genellikle daha rahattır. Satın almadan önce aracın belgesindeki desteklenen kart listesini mutlaka kontrol edin. llama.cpp ayrıca Vulkan arka ucuyla geniş donanım yelpazesinde çalışabilir; hız ve uyumluluk sürüme göre değişir.
Apple Silicon (M serisi) tarafında bellek birleşik (unified) yapıdadır: CPU ve GPU aynı belleği paylaşır. Bu, 16, 32 ya da daha fazla GB'lık bir Mac'te görece büyük modelleri çalıştırmayı mümkün kılar; ancak belleğin tamamı model için kullanılamaz, işletim sisteminin payı vardır. Apple'ın Metal altyapısı Ollama, llama.cpp ve MLX gibi araçlarla destekleniyor. Üretim hızı genellikle üst seviye ayrık kartlardan düşüktür, ama bellek miktarı sayesinde büyük modelleri sığdırmak kolaydır. Bu yazıdaki "ekran kartı" kavramı bu yüzden Mac'te "bellek miktarı" olarak okunmalıdır. Eğitim tarafında ise CUDA ekosistemi kadar olgun değildir.
| Platform | Güçlü yanı | Zayıf yanı |
|---|---|---|
| NVIDIA (CUDA) | En geniş araç ve belge desteği, ince ayarda en rahat yol | Yüksek VRAM'li modeller pahalı olabilir |
| AMD (ROCm, Vulkan) | Bazı modellerde fiyat/VRAM avantajı | Destek karta ve sürüme bağlı, kurulum zahmeti artabilir |
| Apple Silicon (Metal, MLX) | Birleşik bellekle büyük model sığdırma, sessiz ve düşük güç | Eğitim ve bazı araçlarda sınırlı, ham hız daha düşük olabilir |
Ekran Kartı Seviyesine Göre Ne Yapılabilir?
Aşağıdaki tablo VRAM seviyesine göre genel bir beklenti verir. Hız rakamı vermiyoruz çünkü kart modeli, sürücü, bağlam uzunluğu ve araç sürümüne göre fark çok büyüktür. Rakamları kesin söz olarak değil, yön gösterici olarak okuyun.
| VRAM | Rahat çalışan metin modelleri (4 bit civarı) | Görüntü üretimi | İnce ayar |
|---|---|---|---|
| 4 GB | 1-3B sınıfı küçük modeller | Eski ve küçük modeller, düşük çözünürlük, bazı hileler gerekir | Pratik değil |
| 6-8 GB | 7-8B sınıfı modeller (kısa bağlamla) | Orta sınıf modeller, düşük bellek ayarlarıyla | Çok küçük modellerde deneme |
| 12 GB | 7-8B rahat, 14B sınırda | Çoğu popüler model rahat | QLoRA ile 7-8B denemesi mümkün |
| 16 GB | 14B sınıfı rahat | Daha büyük modeller ve yüksek çözünürlük | QLoRA ile 7-14B daha rahat |
| 24 GB | 30B civarı modeller sığabilir | Büyük modeller, ek araçlarla birlikte | QLoRA ile orta büyük modeller |
| 48 GB ve üstü | 70B sınıfı için 4 bit sığabilir (genelde birden çok kartla) | Neredeyse hepsi | Daha büyük modellerde QLoRA |
Ekran kartınızın kaç GB olduğunu bilmiyorsanız Windows'ta Görev Yöneticisi'nin Performans sekmesinde, NVIDIA kartlarda ise komut satırında nvidia-smi çıktısında görebilirsiniz. Dizüstü bilgisayarlarda aynı model adı farklı VRAM miktarlarıyla satılabildiği için tam model adından emin olun. Yerleşik (entegre) ekran kartları ayrı VRAM taşımaz, sistem belleğini paylaşır; bu durumda model çoğunlukla işlemci ve RAM ile çalışır, hız düşer ama küçük modeller yine denenebilir.
Isınma, Güç ve Soğutma
Yapay zeka işleri oyun yükünden farklı olabilir. Özellikle ince ayar ve uzun süre toplu üretim, kartı dakikalar ve saatler boyunca yüksek yükte tutar. Bu, sıcaklığı ve fan gürültüsünü artırır; kasanızın hava akışı yetersizse kart hızını kendiliğinden düşürebilir (termal kısılma). Eğitim sırasında sıcaklığı izleyin, kasa fanlarını ve tozu kontrol edin, gerekirse fan eğrisini ayarlayın. Dizüstü bilgisayarlarda uzun eğitimler hem ısınma hem batarya ve fiş gücü açısından zorlayıcıdır; kısa denemeler için uygun, uzun işler için pek değildir.
Güç tarafında kartın tavsiye edilen güç kaynağı gücünü karşılayın. Yüksek güçlü kartlarda kablo ve bağlantı kalitesi de önemlidir. Sürekli çalışan bir yerel sunucu elektrik faturasına da yansır; bunu bulut maliyeti ile kıyaslarken hesaba katın. Kullanmadığınız zamanlarda modeli bellekten boşaltmak (Ollama bir süre sonra bunu varsayılan olarak yapar) hem VRAM'i hem de gücü serbest bırakır. Sıcaklıkla ilgili genel bilgilere tek bir aracın uyarısı yetmez; kartınızın üreticisinin belirttiği güvenli sıcaklık aralığına bakın.
Bulut ile Maliyet Karşılaştırması
Yerel çalışmanın ilk avantajı kullanım başına ücretin olmamasıdır; kartı zaten aldıysanız her deneme bedavadır. İkinci avantaj gizliliktir: verileriniz bilgisayarınızdan çıkmaz. Üçüncüsü çevrimdışı çalışabilmektir. Bulutun avantajı ise esneklik ve ölçektir: ihtiyaç duyduğunuz an çok büyük bir model ya da çok güçlü bir kart kiralarsınız, işiniz bitince bırakırsınız. Donanım bakımı, ısınma ve güncelleme derdiniz olmaz.
| Ölçüt | Yerel kart | Bulut (API veya kiralık GPU) |
|---|---|---|
| Başlangıç maliyeti | Yüksek (kart yoksa), varsa sıfır | Düşük, kullandıkça öde |
| Kullanım başına maliyet | Elektrik dışında yok | Kullanıma göre artar |
| Model boyutu sınırı | VRAM'e bağlı | Çok büyük modellere erişim |
| Gizlilik | Veri yerelde kalır | Sağlayıcının koşullarına bağlı |
| Ölçeklenme | Sınırlı | Kolay |
| Bakım | Sizde | Sağlayıcıda |
Hangisinin ucuz olduğu kullanım yoğunluğuna bağlıdır. Seyrek ve kısa deneme yapıyorsanız bulut çoğu zaman daha ucuz kalır; her gün saatlerce çalışıyorsanız ve kart zaten sizdeyse yerel yol avantajlıdır. Güncel fiyatlar sık değiştiği için kesin rakam vermiyoruz; kendi kullanımınızı (günlük istek sayısı, ortalama metin uzunluğu) saptayıp sağlayıcıların fiyat sayfalarıyla hesaplayın. Akıllıca yol çoğu zaman karma olandır: geliştirme ve gizli veriyle yerelde, nadir ağır işler için bulutta çalışmak.
Sık Yapılan Hatalar ve Çözümleri
İlk denemelerde karşılaşılan sorunların çoğu aynı birkaç nedene dayanır. Aşağıdaki tablo en sık görülenleri toplar.
| Sorun | Olası neden | Ne yapılır? |
|---|---|---|
| "Out of memory" veya VRAM yetmedi hatası | Model ya da bağlam çok büyük | Daha küçük model veya daha düşük bit kuantizasyonu seçin, bağlamı kısın, başka GPU kullanan programları kapatın |
| Çok yavaş yanıt | Model kısmen RAM'e taşınmış | Modelin tamamen VRAM'e sığdığından emin olun, daha küçük model deneyin |
| GPU hiç kullanılmıyor | Sürücü eksik, uyumsuz sürüm ya da desteklenmeyen kart | Güncel sürücüyü kurun, aracın belgesindeki desteklenen kart listesine bakın |
| Türkçe cevaplar zayıf | Model Türkçeyi az görmüş | Çok dilli bir model seçin, sistem talimatında dili belirtin, örnek verin |
| RAG yanlış cevap veriyor | Arama yanlış parçaları buluyor | Parçalama boyutunu ve gömme modelini değiştirin, deneme setiyle ölçün |
| Eğitimde bellek bitiyor | Parti boyutu veya dizi uzunluğu yüksek | Parti boyutunu düşürüp gradyan biriktirme kullanın, QLoRA'ya geçin |
| Uydurma bilgi (halüsinasyon) | Model emin olmadığı yerde üretiyor | RAG ile kaynak verin, "bilmiyorsan söyle" talimatı ekleyin, kritik sonuçları doğrulayın |
| Kart aşırı ısınıyor | Yetersiz hava akışı | Kasayı temizleyin, fan eğrisini ayarlayın, yükü düşürün |
Bir diğer sık hata, yapay zeka çıktısını denetimsiz kullanmaktır. Küçük yerel modeller büyük bulut modellerine göre daha sık hata yapabilir. Önemli bir iş için çıktıları insan gözüyle kontrol edin, uygulamanıza basit doğrulama adımları ekleyin. Bir başka hata da çok erken ince ayara atlamaktır; çoğu zaman iyi yazılmış bir sistem talimatı ve RAG aynı sonucu çok daha ucuza verir.
Ticari Kullanım ve Model Lisansı Notu
Bir modeli yerelde çalıştırıyor olmanız, onu istediğiniz gibi ticari olarak kullanabileceğiniz anlamına gelmez. Her model kendi lisansıyla gelir. Bazı modeller geniş serbestlik tanıyan lisanslarla (örneğin Apache 2.0 gibi) dağıtılır; bazıları ise kullanım koşulları, kullanıcı sayısı sınırı ya da yasaklı kullanım alanları gibi şartlar koyar. Görüntü modellerinde de benzer farklar vardır. "Açık ağırlıklı" ifadesi her zaman "tamamen özgür" demek değildir.
Ticari bir ürün planlıyorsanız şu adımları izleyin: kullandığınız modelin sayfasındaki lisans metnini okuyun; ince ayar yaptığınız modelin türev eser sayılıp sayılmadığını ve adaptörün dağıtım şartlarını kontrol edin; eğitimde kullandığınız verinin hakları size ait mi bakın; kişisel veri işliyorsanız ilgili veri koruma mevzuatını (KVKK, GDPR) düşünün; gerekirse bir hukukçuya danışın. Bu yazı hukuki tavsiye değildir, yalnızca nelere bakmanız gerektiğini gösterir. Lisanslar zamanla değişebileceği için güncel metni kaynağından okuyun.
Adım Adım Başlangıç Planı
Sıfırdan başlıyorsanız aşağıdaki sıra, en az zahmetle en çok öğrenmenizi sağlar. İlk gün yalnızca modeli çalıştırıp birkaç soru sorun. İkinci adımda aynı modeli kendi kodunuzdan çağırın ve cevabı ekrana akış olarak yazdırın. Üçüncü adımda sistem talimatıyla modele bir rol verin ve çıktı biçimini sabitleyin; örneğin her zaman belirli alanları içeren kısa bir yapı istemek, uygulamanızı çok daha öngörülebilir kılar. Dördüncü adımda küçük bir belge koleksiyonuyla RAG kurun ve deneme sorularıyla ölçün. Beşinci adımda kullanıcı arayüzünü ve hata yönetimini düzeltin. Altıncı adımda gerçekten ihtiyaç duyuyorsanız görüntü üretimi ya da ince ayar ekleyin.
Her aşamada iki şeyi yapın: ne kadar VRAM kullandığınızı izleyin ve kendi örnek sorularınızla sonucu ölçün. VRAM kullanımını NVIDIA'da nvidia-smi ile, diğer platformlarda sistem izleme araçlarıyla görebilirsiniz. Ölçmeden yapılan iyileştirmeler çoğu zaman yanıltır. Son olarak, çalışan sürümünüzün hangi model ve hangi kuantizasyonla test edildiğini not edin; model güncellendiğinde davranış değişebilir ve geri dönmek gerekebilir.
Sık Sorulan Sorular
Ekran kartım yoksa yapay zeka uygulaması geliştiremez miyim?
Geliştirebilirsiniz. Küçük modeller işlemci ve RAM ile de çalışır, sadece daha yavaştır. Ayrıca geliştirme sırasında bulut API'lerini kullanıp daha sonra yerel modele geçebilirsiniz.
Hangi ekran kartı yapay zeka için en iyisi?
Tek bir doğru cevap yok; bütçeye ve hedefe bağlıdır. Genel kural olarak aynı fiyat bandında daha fazla VRAM'li kart tercih edilir ve araç desteği açısından NVIDIA en az sürprizli yoldur. Satın almadan önce kullanmak istediğiniz aracın desteklediği kartları kontrol edin.
8 GB VRAM yeterli mi?
Küçük ve orta ölçekli modellerle öğrenmek, 7-8B sınıfı bir modelle sohbet ve basit RAG denemeleri için kabaca yeterlidir. Daha büyük modeller, uzun bağlam ve ince ayar için sınırlayıcı olur.
Ollama ile LM Studio arasındaki fark nedir?
Ollama komut satırı ve API odaklıdır, geliştirici akışına uyar. LM Studio görsel arayüz sunar ve model keşfini kolaylaştırır. İkisi de yerel sunucu açabilir; sizin için hangisi rahatsa onu seçin, birlikte de kullanabilirsiniz.
Kuantizasyon kaliteyi çok düşürür mü?
Bit sayısı düştükçe kalite bir miktar azalır. 4 bit civarı çoğu günlük iş için makul bir denge sayılır; çok düşük bitlerde fark belirginleşir. Kendi sorularınızla iki sürümü karşılaştırmak en doğru yoldur.
RAG mı, ince ayar mı yapmalıyım?
Modelin kendi belgelerinizden bilgi kullanmasını istiyorsanız önce RAG. Üslup, çıktı biçimi veya dar bir davranışı değiştirmek istiyorsanız ince ayarı düşünün. İkisi birlikte de kullanılabilir.
Evdeki kartla sıfırdan model eğitebilir miyim?
Öğrenme amacıyla çok küçük modeller eğitilebilir, ancak kullanışlı genel amaçlı bir dil modelini sıfırdan eğitmek evdeki donanımla gerçekçi değildir. Hazır modeli uyarlamak (LoRA/QLoRA) çok daha pratik bir yoldur.
AMD kartım var, kullanabilir miyim?
Çoğu zaman evet, ama destek karta, sürücüye ve işletim sistemine göre değişir. Ollama ve llama.cpp belgelerindeki desteklenen donanım listesini kontrol edin. Eğitim araçlarında NVIDIA kadar rahat olmayabilirsiniz.
Mac'imde yapay zeka uygulaması geliştirebilir miyim?
Evet. Apple Silicon'da birleşik bellek sayesinde görece büyük modeller çalışabilir; Ollama, LM Studio, llama.cpp ve MLX gibi araçlar Metal desteğiyle kullanılabilir. Eğitim tarafı CUDA kadar olgun değildir.
Yerel modeller bulut modelleri kadar iyi mi?
Genelde en büyük bulut modelleri daha yeteneklidir. Yine de dar ve iyi tanımlanmış görevlerde, özellikle RAG ile desteklenmiş küçük yerel modeller yeterli olabilir. Kritik işlerde çıktıyı doğrulayın.
Yaptığım uygulamayı satabilir miyim?
Kullandığınız modelin ve verinin lisansına bağlıdır. Bazı modeller ticari kullanıma izin verir, bazıları kısıtlar. Satıştan önce lisansı okuyun, gerekirse hukuki destek alın.
Kart sürekli çalışırsa ömrü kısalır mı?
Aşırı ısınma ve kötü soğutma donanım için risklidir. Sıcaklığı güvenli aralıkta tutar ve toz temizliğini yaparsanız normal kullanım koşullarında endişe gerektirecek bir durum beklenmez; kesin garanti vermek mümkün değildir.

Yorumlar (0)
Yorum Yaz
Henüz yorum yapılmamış. İlk yorumu siz yapın!