Hoşgeldiniz! Tüm servislerde %30'a varan indirimler başladı.
Anasayfa
Hizmetler
Instagram YouTube TikTok Twitter Facebook Web Tasarım Hizmeti YeniUzman ekiple 1 haftada, sabit fiyat
Avantajlar
Telafi Talebi Garanti Ödül Kazan +25 ₺
Keşfet
SSS Blog Ücretsiz Araçlar
Kurumsal
Sepetim 0
Siparişi Tamamla
Toplam Ödenecek0.00 ₺
Sipariş Takip

Sipariş numaranızı girerek durumunuzu kontrol edin

Siparişinizi Takip Edin

Tüm siparişlerinizin durumunu anlık olarak görüntüleyin.

Anlık durum güncellemesi
İlerleme takibi
Sipariş geçmişi
Hoşgeldiniz

Hesabınıza giriş yapın

Şifremi Unuttum

Hesabınız yok mu? Kayıt Ol

Sosyal Medya Gücü

En popüler platformlarda hızla büyüyün.

Anında teslimat
Güvenli alışveriş
7/24 destek
Teknoloji

Kendi Ekran Kartımı Kullanarak Kendi Yapay Zeka Uygulamamı Geliştirebilir Miyim?

Takipox Takipox 2 Ekim 2026 14

Evet, kendi ekran kartınızla kendi yapay zeka uygulamanızı geliştirebilirsiniz. Yerel bir dil modelini çalıştırıp onu kendi kodunuzdan çağırmak, belgelerinizle konuşan bir asistan (RAG) kurmak, Stable Diffusion benzeri modellerle görüntü üretmek ve küçük modellere LoRA ile ince ayar yapmak orta seviye bir kartla bile mümkündür. Sınırı çoğunlukla işlemci gücü değil, kartın video belleği (VRAM) belirler.

Hızlı sıra şudur: (1) Kartınızın markasını ve VRAM miktarını öğrenin; (2) Ollama veya LM Studio kurup 7-8 milyar parametrelik küçük bir model deneyin; (3) Modelin yerel API'sine basit bir betikle bağlanın; (4) Belgeleriniz için RAG ekleyin; (5) Görüntü üretimi ve ince ayarı ancak bunlar oturduktan sonra deneyin; (6) Ticari bir ürün düşünüyorsanız model lisansını okuyun.

Kısa Cevap: Ne Kadarı Mümkün, Ne Kadarı Değil?

Evdeki bir ekran kartı, dev bulut modellerinin yerini tutmaz ama gerçek ve kullanışlı uygulamalar için fazlasıyla yeterlidir. Pratikte şunlar rahatça yapılabilir: günlük sohbet ve yazı asistanı, metin özetleme, sınıflandırma, bilgi çıkarma, kod yardımcısı, kendi PDF ve notlarınızda arama yapan bir asistan, görsel üretimi ve küçük veri setleriyle ince ayar. Şunlar ise genellikle zordur: çok büyük modelleri (onlarca milyar parametre üstü) akıcı hızda çalıştırmak, sıfırdan model eğitmek ve aynı anda yüzlerce kullanıcıya hizmet vermek.

Önemli bir ayrım yapmakta fayda var. "Yapay zeka uygulaması geliştirmek" ile "yapay zeka modeli eğitmek" aynı şey değildir. Uygulama geliştirmek çoğu zaman hazır, açık bir modeli kendi yazılımınıza bağlamaktır. Bu iş için güçlü bir ekran kartı gerekmez; model yerelde çalışıyorsa bile uygulamanın geri kalanı sıradan bir web veya masaüstü yazılımıdır. Model eğitmek ise çok daha fazla bellek, zaman ve veri ister. Bu yazıda ağırlığı uygulama tarafına vereceğiz, ince ayarın neye yettiğini ayrı bir bölümde ele alacağız.

İşEvdeki kartla mümkün mü?Not
Yerel sohbet modeli çalıştırmakEvetKüçük ve orta modeller rahat çalışır
Kendi belgelerinizle RAG asistanıEvetKüçük bir model ve gömme (embedding) modeli yeter
Görüntü üretimi (Stable Diffusion)EvetModel sürümüne göre VRAM ihtiyacı değişir
LoRA / QLoRA ince ayarKüçük modellerde evetBellek ihtiyacı model ve ayarlara bağlıdır
Sıfırdan büyük model eğitmekHayırKüme ve ciddi bütçe gerektirir
Çok kullanıcılı canlı servisSınırlıTek kullanıcı veya küçük ekip için uygundur

VRAM Neden Bu Kadar Önemli?

Bir yapay zeka modeli, çalışırken bütün ağırlıklarını hızlı erişilebilir bellekte tutmak ister. Ekran kartında bu bellek VRAM'dir. Model VRAM'e tamamen sığarsa kartın hızlı belleği ve hesaplama birimleri tam verimle kullanılır. Sığmazsa bir kısmı sistem belleğine (RAM) taşınır ve işlemci devreye girer; bu durumda üretim hızı belirgin biçimde düşer. Ollama gibi araçlar bunu otomatik yapar, yani model "çalışır" ama yavaşlar. Yaygın pratik gözlem, kısmi yüklemede hızın birkaç kat, hatta çok daha fazla düştüğüdür; kesin çarpan donanıma ve modele göre değişir.

Bu yüzden ekran kartı seçerken ya da mevcut kartınızı değerlendirirken çekirdek sayısından önce VRAM miktarına bakın. Aynı nesilde 8 GB'lık bir kart ile 16 GB'lık bir kart arasındaki fark, çalıştırabileceğiniz model sınıfını değiştirir. Hesaplama gücü ise modelin ne kadar hızlı yanıt üreteceğini belirler; yani VRAM "çalışır mı?" sorusunu, hesaplama gücü "ne kadar akıcı?" sorusunu cevaplar.

VRAM yalnızca model ağırlıklarına gitmez. Bağlam penceresi (modelin aynı anda hatırladığı metin miktarı) için ayrılan önbellek (KV cache), uzadıkça bellek tüketir. Ayrıca sürücü, işletim sistemi ve ekranı çizen programlar da VRAM kullanır. Bu yüzden "model dosyası 6 GB, kartım 8 GB, sığar" hesabı çoğu zaman sınırda kalır; kendinize pay bırakın.

Model Boyutu ve Kuantizasyon İlişkisi

Modeller parametre sayısıyla anılır: 3B, 7B, 8B, 14B, 32B, 70B gibi (B = milyar). Her parametre bellekte belli bir sayıda bayt tutar. Tam hassasiyette (FP16) bir parametre yaklaşık 2 bayt eder; yani 7B bir model kabaca 14 GB tutar. Kuantizasyon, ağırlıkları daha az bitle saklayarak boyutu küçültür. 4 bit civarında bir kuantizasyonda parametre başına yaklaşık yarım bayt gerekir; yani 7B model kabaca 4 ila 5 GB'a iner. Ollama'nın kütüphanesindeki birçok model varsayılan olarak 4 bit civarı bir kuantizasyonla gelir.

Aşağıdaki tablo yalnızca kabaca bir kuraldır. Gerçek değerler model mimarisine, kuantizasyon türüne, bağlam uzunluğuna ve kullandığınız araca göre değişir; kesin rakam olarak okumayın.

Model boyutuFP16 (kabaca)8 bit (kabaca)4 bit (kabaca)
3B6 GB3-4 GB2-3 GB
7B - 8B14-16 GB7-9 GB4-6 GB
14B28 GB14-16 GB8-10 GB
32B64 GB32-35 GB18-22 GB
70B140 GB70-75 GB38-45 GB

Bu rakamlara bağlam önbelleği ve çalışma payı eklenir. Pratik kural: model dosyasının boyutuna biraz pay ekleyin ve toplamın VRAM'inizin altında kaldığından emin olun. Kuantizasyonun bir bedeli vardır: bit sayısı düştükçe kalite bir miktar azalır. 4 bit civarı çoğu günlük iş için kabul edilebilir bir denge sayılır; çok düşük bitlerde (2-3 bit) kalite kaybı daha görünür hale gelir. Hangi seviyenin sizin işiniz için yeterli olduğunu denemeden bilemezsiniz, bu yüzden aynı modelin iki farklı kuantizasyonunu kendi örnek sorularınızla karşılaştırmak iyi bir alışkanlıktır.

Bir de "uzman karışımı" (MoE) modeller vardır. Bunlar toplamda büyük olsa da her adımda parametrelerinin yalnızca bir bölümünü kullanır. Hız avantajı sağlayabilirler ama bütün ağırlıkların yine bellekte durması gerektiği için VRAM ihtiyacı toplam boyuta göre belirlenir. Model sayfasındaki boyut bilgisine bakmak en güvenlisidir.

Yerelde Model Çalıştırma Araçları: Ollama, LM Studio, llama.cpp

Modeli kendiniz yüklemeniz, derlemeniz ya da ayarlamanız gerekmez; bu işi yapan olgun araçlar var. Üçü de açık veya ücretsiz biçimde kullanılabilir ve birbirine yakın bir çekirdeği paylaşır.

AraçKime uygun?Güçlü yanıDikkat edilecek nokta
OllamaGeliştiriciler, hızlı başlangıçTek komutla model indirme ve çalıştırma, yerel API sunarAyrıntılı ayar için model dosyası (Modelfile) bilmek gerekebilir
LM StudioKod yazmadan denemek isteyenlerGörsel arayüz, model arama ve indirme, yerel sunucu moduArayüz uygulaması; sunucuya göre daha az otomasyon dostu olabilir
llama.cppİnce kontrol isteyenlerÇok çeşitli donanımda çalışır, GGUF biçimi, birçok aracın temeliDerleme ve komut satırı bayrakları öğrenme eğrisi ister

Başlangıç için en kolay yol genellikle Ollama veya LM Studio'dur. Ollama'yı kurduktan sonra komut satırından bir modeli indirip çalıştırabilirsiniz; arka planda bir yerel sunucu açılır ve uygulamanız bu sunucuya HTTP isteği atar. llama.cpp ise bu araçların birçoğunun altında yatan motordur; özel bir senaryonuz varsa (belirli donanım, belirli bayraklar, GGUF dönüştürme) doğrudan kullanmak isteyebilirsiniz. Her aracın kurulum adımları sürüme göre değişebilir; güncel komutlar için kendi resmi belgelerine bakın.

Modeller çoğunlukla GGUF adlı bir dosya biçiminde dağıtılır. Dosya adında Q4_K_M, Q5_K_M, Q8_0 gibi ekler görürsünüz; bunlar kuantizasyon türünü gösterir. Sayı yaklaşık bit düzeyidir, harfler ise yöntemin ayrıntısıdır. Emin değilseniz araçların önerdiği varsayılan sürümle başlayın.

Uygulama Geliştirme Akışı: Yerel API Üzerinden Basit Bir Uygulama

Yerel model çalıştığında asıl iş başlar: onu kendi yazılımınızın parçası yapmak. Akış genellikle şöyledir. Önce modeli arka planda çalışan bir yerel sunucu olarak açarsınız. Sonra uygulamanız bu sunucuya bir istek gönderir; istek içinde konuşma mesajları ve model adı bulunur. Sunucu cevabı üretir, uygulamanız bunu ekrana basar ya da bir sonraki adımda kullanır. Ollama'nın kendi API'si olduğu gibi, birçok yerel sunucu OpenAI uyumlu bir uç nokta da sunar; bu sayede aynı kodu değiştirmeden yerel ve bulut modeller arasında geçiş yapabilirsiniz. Uyumluluğun kapsamı sürüme göre değiştiği için kullandığınız aracın belgesini kontrol edin.

Basit bir uygulama için tipik parçalar şunlardır: bir ön yüz (web sayfası ya da masaüstü pencere), modelle konuşan küçük bir arka uç (Python veya JavaScript), sistem talimatı (modelin rolünü ve üslubunu belirleyen metin) ve konuşma geçmişi. İlk sürümde bunların hepsi tek bir dosyada olabilir. Ön yüzü hazırlarken sıradan web bileşenleriyle uğraşırsınız; bu konuda takıldığınız yerler için iframe sorunları gibi sıradan web konularını da hatırlatmak isteriz: yapay zeka uygulamanızı bir sayfaya gömmeyi düşünüyorsanız bu tür ayrıntılar karşınıza çıkacaktır.

Üretim hızını kullanıcıya hissettirmek için yanıtı akış (streaming) olarak göstermek iyi bir alışkanlıktır. Model kelimeleri üretirken ekrana düşürürseniz, toplam süre aynı olsa bile uygulama daha hızlı hissedilir. Ayrıca zaman aşımı, hata mesajı ve "model yükleniyor" durumu gibi uç durumları baştan düşünün; yerel modelin ilk istekte belleğe yüklenmesi birkaç saniye sürebilir.

Güvenlik tarafında bir uyarı: yerel sunucuyu varsayılan olarak yalnızca kendi bilgisayarınızdan erişilebilir bırakın. Onu ağa ya da internete açmak istiyorsanız kimlik doğrulama ve ters vekil (reverse proxy) gibi önlemler gerekir. Uygulamanız kullanıcıdan gelen metni modele aktarıyorsa, kötü niyetli girdilerin modelin talimatını bozmaya çalışabileceğini (prompt injection) de hesaba katın. Uygulamanızın güvenliğini bağımsız biçimde sınatmak isterseniz sızma testi yazımız bu sürecin ne olduğunu özetliyor.

Kendi Belgelerinizle Konuşan Uygulama: RAG

RAG (Retrieval-Augmented Generation), modeli yeniden eğitmeden onun kendi belgelerinizden bilgi kullanmasını sağlayan yöntemdir. Çoğu "kendi verimle çalışan yapay zeka" ihtiyacı için ince ayardan daha uygun, daha ucuz ve daha kolay güncellenir bir çözümdür. Mantığı basittir: belgelerinizi parçalara bölersiniz, her parçayı bir gömme (embedding) modeliyle sayısal bir vektöre çevirirsiniz, vektörleri bir veri tabanında saklarsınız. Kullanıcı soru sorduğunda sorunun da vektörü çıkarılır, en yakın parçalar bulunur ve bu parçalar soruyla birlikte modele verilir. Model cevabı bu metinlere dayanarak yazar.

AdımNe yapılır?Dikkat
1. Belge hazırlamaPDF, not, sayfa metnini temiz metne çevirmekTablolar ve taranmış belgeler ek iş gerektirir
2. ParçalamaMetni anlamlı bölümlere ayırmakÇok küçük parça bağlamı kaybettirir, çok büyük parça gürültü katar
3. GömmeParçaları vektöre çevirmekTürkçe için çok dilli bir gömme modeli seçin
4. SaklamaVektör veri tabanına yazmakKüçük projede basit yerel çözümler yeter
5. Arama ve cevapİlgili parçaları bulup modele vermekCevaba kaynak göstermek güveni artırır

RAG'in en büyük avantajı güncellemedir: belgeleriniz değiştiğinde modeli değil yalnızca arama dizinini yenilersiniz. Dezavantajı, cevabın kalitesinin arama kalitesine bağlı olmasıdır. Yanlış parçalar bulunursa model yanlış cevap verir. Bu yüzden önce küçük bir deneme seti hazırlayın: yirmi otuz gerçek soru ve beklenen cevaplar. Her değişiklikten sonra bu soruları yeniden sorup sonuçları karşılaştırın.

Gömme modelleri genellikle küçüktür ve düşük VRAM'le, hatta işlemciyle bile çalışır. Asıl bellek yükü sohbet modelindedir. Bağlama çok fazla parça koymak hem hızı düşürür hem de VRAM tüketimini artırır; bu yüzden en ilgili birkaç parçayı seçmek genellikle hepsini vermekten daha iyidir.

Görüntü Üretimi: Stable Diffusion ve Benzerleri

Metinden görüntü üreten difüzyon modelleri de yerelde çalışabilir. Stable Diffusion ailesi ve benzeri açık modeller için ComfyUI, AUTOMATIC1111 tabanlı arayüzler ya da Hugging Face Diffusers kütüphanesi gibi araçlar kullanılır. Burada da belirleyici faktör VRAM'dir: model sürümü büyüdükçe ve üretilen görüntünün çözünürlüğü arttıkça bellek ihtiyacı artar. Daha yeni ve büyük modeller daha fazla bellek ister; eski ve küçük sürümler daha mütevazı kartlarda çalışır. Kesin rakam için seçtiğiniz modelin ve arayüzün belgesine bakın.

Düşük VRAM'li kartlarda yardımcı olan teknikler vardır: yarı hassasiyette (FP16) çalışmak, kuantize edilmiş model sürümleri kullanmak, bazı katmanları geçici olarak RAM'e almak (offload) ve çözünürlüğü düşük başlatıp sonradan büyütmek. Bunlar hızı biraz düşürebilir ama kartınızı çalışır hale getirir. Görüntü üretimini bir uygulamaya bağlamak istiyorsanız ComfyUI ve benzeri araçların API sunduğunu görürsünüz; yani yerel dil modelinde yaptığınız gibi bir istek atıp görüntü alabilirsiniz.

Telif ve içerik konusunda dikkatli olun. Modelin lisansı ticari kullanıma izin vermeyebilir, ayrıca üretilen görüntülerde kişilerin görüntü hakları ve marka içerikleri gibi hukuki konular ortaya çıkabilir. Ticari kullanım bölümünde bunu ayrıca ele alıyoruz.

İnce Ayar (LoRA ve QLoRA) Neye Yeter?

İnce ayar, hazır bir modelin davranışını kendi örneklerinizle biraz değiştirmektir. Tam ince ayar bütün parametreleri günceller ve çok bellek ister. LoRA ise orijinal ağırlıkları dondurup yalnızca küçük, eklenen "adaptör" katmanlarını eğitir; bellek ve zaman ihtiyacı belirgin biçimde azalır. QLoRA bir adım ileri gider: temel modeli 4 bit kuantize edilmiş halde tutar, adaptörleri daha yüksek hassasiyette eğitir. QLoRA makalesi bu yöntemle 65B parametreli bir modelin tek 48 GB'lık kartta ince ayarının yapılabildiğini bildirir; bu, yöntemin tavanını gösteren bir örnektir, evdeki kart için hedef değildir.

YöntemNe eğitilir?Bellek ihtiyacıEvdeki kart için uygunluk
Tam ince ayarTüm parametrelerÇok yüksek (ağırlık, gradyan, optimizer durumu)Yalnızca çok küçük modellerde
LoRAKüçük adaptörlerOrta; temel model genelde 16 bit tutulurKüçük ve orta modellerde
QLoRAAdaptörler, temel model 4 bitEn düşükOrta seviye kartlarda küçük modeller için en gerçekçi yol

Ev tipi kartlarla gerçekçi hedef şudur: 7-8B sınıfı bir modele, belirli bir üslup, biçim ya da dar bir görev için QLoRA ile adaptör eğitmek. Veri seti küçük olabilir ama kaliteli olmalıdır; yüzlerce ila birkaç bin temiz örnek çoğu dar görev için bir başlangıçtır, ancak kesin sayı göreve bağlıdır. Eğitim sırasında bellek, parti boyutu (batch size), dizi uzunluğu ve gradyan biriktirme ayarlarına duyarlıdır; VRAM yetmezse bunları düşürürsünüz.

İnce ayarın ne yapmadığını da bilin: modelin bilgi dağarcığını güvenilir biçimde genişletmez. Şirketinizin belgelerinden cevap verilmesini istiyorsanız önce RAG'i deneyin. İnce ayarı üslup, çıktı biçimi, belirli bir sınıflandırma ya da ton gibi davranış değişiklikleri için düşünün. Eğitim araçları olarak Hugging Face Transformers, PEFT, TRL ve bitsandbytes kütüphaneleri sık kullanılır; Unsloth gibi bellek dostu araçlar da vardır. Hangisini seçerseniz seçin, sürüm uyumluluğuna dikkat edin, çünkü bu kütüphaneler hızlı değişiyor.

NVIDIA, AMD ve Apple Silicon Farkı

Yapay zeka araçlarının büyük kısmı önce NVIDIA'nın CUDA platformu için yazıldı. Bu yüzden NVIDIA kartlarda destek en geniş, belge ve topluluk yardımı en bol olandır. PyTorch, bitsandbytes ve ince ayar araçlarının birçok özelliği CUDA ile en sorunsuz çalışır. Yeni bir aracı denerken "NVIDIA'da çalışıyor mu?" sorusu çoğu zaman olumlu cevaplanır.

AMD kartlar ROCm yığınıyla desteklenir. Ollama ve llama.cpp belirli AMD kartlarını destekler; ancak destek listesi karta, sürücüye ve işletim sistemine göre değişir. Linux'ta genellikle daha rahattır. Satın almadan önce aracın belgesindeki desteklenen kart listesini mutlaka kontrol edin. llama.cpp ayrıca Vulkan arka ucuyla geniş donanım yelpazesinde çalışabilir; hız ve uyumluluk sürüme göre değişir.

Apple Silicon (M serisi) tarafında bellek birleşik (unified) yapıdadır: CPU ve GPU aynı belleği paylaşır. Bu, 16, 32 ya da daha fazla GB'lık bir Mac'te görece büyük modelleri çalıştırmayı mümkün kılar; ancak belleğin tamamı model için kullanılamaz, işletim sisteminin payı vardır. Apple'ın Metal altyapısı Ollama, llama.cpp ve MLX gibi araçlarla destekleniyor. Üretim hızı genellikle üst seviye ayrık kartlardan düşüktür, ama bellek miktarı sayesinde büyük modelleri sığdırmak kolaydır. Bu yazıdaki "ekran kartı" kavramı bu yüzden Mac'te "bellek miktarı" olarak okunmalıdır. Eğitim tarafında ise CUDA ekosistemi kadar olgun değildir.

PlatformGüçlü yanıZayıf yanı
NVIDIA (CUDA)En geniş araç ve belge desteği, ince ayarda en rahat yolYüksek VRAM'li modeller pahalı olabilir
AMD (ROCm, Vulkan)Bazı modellerde fiyat/VRAM avantajıDestek karta ve sürüme bağlı, kurulum zahmeti artabilir
Apple Silicon (Metal, MLX)Birleşik bellekle büyük model sığdırma, sessiz ve düşük güçEğitim ve bazı araçlarda sınırlı, ham hız daha düşük olabilir

Ekran Kartı Seviyesine Göre Ne Yapılabilir?

Aşağıdaki tablo VRAM seviyesine göre genel bir beklenti verir. Hız rakamı vermiyoruz çünkü kart modeli, sürücü, bağlam uzunluğu ve araç sürümüne göre fark çok büyüktür. Rakamları kesin söz olarak değil, yön gösterici olarak okuyun.

VRAMRahat çalışan metin modelleri (4 bit civarı)Görüntü üretimiİnce ayar
4 GB1-3B sınıfı küçük modellerEski ve küçük modeller, düşük çözünürlük, bazı hileler gerekirPratik değil
6-8 GB7-8B sınıfı modeller (kısa bağlamla)Orta sınıf modeller, düşük bellek ayarlarıylaÇok küçük modellerde deneme
12 GB7-8B rahat, 14B sınırdaÇoğu popüler model rahatQLoRA ile 7-8B denemesi mümkün
16 GB14B sınıfı rahatDaha büyük modeller ve yüksek çözünürlükQLoRA ile 7-14B daha rahat
24 GB30B civarı modeller sığabilirBüyük modeller, ek araçlarla birlikteQLoRA ile orta büyük modeller
48 GB ve üstü70B sınıfı için 4 bit sığabilir (genelde birden çok kartla)Neredeyse hepsiDaha büyük modellerde QLoRA

Ekran kartınızın kaç GB olduğunu bilmiyorsanız Windows'ta Görev Yöneticisi'nin Performans sekmesinde, NVIDIA kartlarda ise komut satırında nvidia-smi çıktısında görebilirsiniz. Dizüstü bilgisayarlarda aynı model adı farklı VRAM miktarlarıyla satılabildiği için tam model adından emin olun. Yerleşik (entegre) ekran kartları ayrı VRAM taşımaz, sistem belleğini paylaşır; bu durumda model çoğunlukla işlemci ve RAM ile çalışır, hız düşer ama küçük modeller yine denenebilir.

Isınma, Güç ve Soğutma

Yapay zeka işleri oyun yükünden farklı olabilir. Özellikle ince ayar ve uzun süre toplu üretim, kartı dakikalar ve saatler boyunca yüksek yükte tutar. Bu, sıcaklığı ve fan gürültüsünü artırır; kasanızın hava akışı yetersizse kart hızını kendiliğinden düşürebilir (termal kısılma). Eğitim sırasında sıcaklığı izleyin, kasa fanlarını ve tozu kontrol edin, gerekirse fan eğrisini ayarlayın. Dizüstü bilgisayarlarda uzun eğitimler hem ısınma hem batarya ve fiş gücü açısından zorlayıcıdır; kısa denemeler için uygun, uzun işler için pek değildir.

Güç tarafında kartın tavsiye edilen güç kaynağı gücünü karşılayın. Yüksek güçlü kartlarda kablo ve bağlantı kalitesi de önemlidir. Sürekli çalışan bir yerel sunucu elektrik faturasına da yansır; bunu bulut maliyeti ile kıyaslarken hesaba katın. Kullanmadığınız zamanlarda modeli bellekten boşaltmak (Ollama bir süre sonra bunu varsayılan olarak yapar) hem VRAM'i hem de gücü serbest bırakır. Sıcaklıkla ilgili genel bilgilere tek bir aracın uyarısı yetmez; kartınızın üreticisinin belirttiği güvenli sıcaklık aralığına bakın.

Bulut ile Maliyet Karşılaştırması

Yerel çalışmanın ilk avantajı kullanım başına ücretin olmamasıdır; kartı zaten aldıysanız her deneme bedavadır. İkinci avantaj gizliliktir: verileriniz bilgisayarınızdan çıkmaz. Üçüncüsü çevrimdışı çalışabilmektir. Bulutun avantajı ise esneklik ve ölçektir: ihtiyaç duyduğunuz an çok büyük bir model ya da çok güçlü bir kart kiralarsınız, işiniz bitince bırakırsınız. Donanım bakımı, ısınma ve güncelleme derdiniz olmaz.

ÖlçütYerel kartBulut (API veya kiralık GPU)
Başlangıç maliyetiYüksek (kart yoksa), varsa sıfırDüşük, kullandıkça öde
Kullanım başına maliyetElektrik dışında yokKullanıma göre artar
Model boyutu sınırıVRAM'e bağlıÇok büyük modellere erişim
GizlilikVeri yerelde kalırSağlayıcının koşullarına bağlı
ÖlçeklenmeSınırlıKolay
BakımSizdeSağlayıcıda

Hangisinin ucuz olduğu kullanım yoğunluğuna bağlıdır. Seyrek ve kısa deneme yapıyorsanız bulut çoğu zaman daha ucuz kalır; her gün saatlerce çalışıyorsanız ve kart zaten sizdeyse yerel yol avantajlıdır. Güncel fiyatlar sık değiştiği için kesin rakam vermiyoruz; kendi kullanımınızı (günlük istek sayısı, ortalama metin uzunluğu) saptayıp sağlayıcıların fiyat sayfalarıyla hesaplayın. Akıllıca yol çoğu zaman karma olandır: geliştirme ve gizli veriyle yerelde, nadir ağır işler için bulutta çalışmak.

Sık Yapılan Hatalar ve Çözümleri

İlk denemelerde karşılaşılan sorunların çoğu aynı birkaç nedene dayanır. Aşağıdaki tablo en sık görülenleri toplar.

SorunOlası nedenNe yapılır?
"Out of memory" veya VRAM yetmedi hatasıModel ya da bağlam çok büyükDaha küçük model veya daha düşük bit kuantizasyonu seçin, bağlamı kısın, başka GPU kullanan programları kapatın
Çok yavaş yanıtModel kısmen RAM'e taşınmışModelin tamamen VRAM'e sığdığından emin olun, daha küçük model deneyin
GPU hiç kullanılmıyorSürücü eksik, uyumsuz sürüm ya da desteklenmeyen kartGüncel sürücüyü kurun, aracın belgesindeki desteklenen kart listesine bakın
Türkçe cevaplar zayıfModel Türkçeyi az görmüşÇok dilli bir model seçin, sistem talimatında dili belirtin, örnek verin
RAG yanlış cevap veriyorArama yanlış parçaları buluyorParçalama boyutunu ve gömme modelini değiştirin, deneme setiyle ölçün
Eğitimde bellek bitiyorParti boyutu veya dizi uzunluğu yüksekParti boyutunu düşürüp gradyan biriktirme kullanın, QLoRA'ya geçin
Uydurma bilgi (halüsinasyon)Model emin olmadığı yerde üretiyorRAG ile kaynak verin, "bilmiyorsan söyle" talimatı ekleyin, kritik sonuçları doğrulayın
Kart aşırı ısınıyorYetersiz hava akışıKasayı temizleyin, fan eğrisini ayarlayın, yükü düşürün

Bir diğer sık hata, yapay zeka çıktısını denetimsiz kullanmaktır. Küçük yerel modeller büyük bulut modellerine göre daha sık hata yapabilir. Önemli bir iş için çıktıları insan gözüyle kontrol edin, uygulamanıza basit doğrulama adımları ekleyin. Bir başka hata da çok erken ince ayara atlamaktır; çoğu zaman iyi yazılmış bir sistem talimatı ve RAG aynı sonucu çok daha ucuza verir.

Ticari Kullanım ve Model Lisansı Notu

Bir modeli yerelde çalıştırıyor olmanız, onu istediğiniz gibi ticari olarak kullanabileceğiniz anlamına gelmez. Her model kendi lisansıyla gelir. Bazı modeller geniş serbestlik tanıyan lisanslarla (örneğin Apache 2.0 gibi) dağıtılır; bazıları ise kullanım koşulları, kullanıcı sayısı sınırı ya da yasaklı kullanım alanları gibi şartlar koyar. Görüntü modellerinde de benzer farklar vardır. "Açık ağırlıklı" ifadesi her zaman "tamamen özgür" demek değildir.

Ticari bir ürün planlıyorsanız şu adımları izleyin: kullandığınız modelin sayfasındaki lisans metnini okuyun; ince ayar yaptığınız modelin türev eser sayılıp sayılmadığını ve adaptörün dağıtım şartlarını kontrol edin; eğitimde kullandığınız verinin hakları size ait mi bakın; kişisel veri işliyorsanız ilgili veri koruma mevzuatını (KVKK, GDPR) düşünün; gerekirse bir hukukçuya danışın. Bu yazı hukuki tavsiye değildir, yalnızca nelere bakmanız gerektiğini gösterir. Lisanslar zamanla değişebileceği için güncel metni kaynağından okuyun.

Adım Adım Başlangıç Planı

Sıfırdan başlıyorsanız aşağıdaki sıra, en az zahmetle en çok öğrenmenizi sağlar. İlk gün yalnızca modeli çalıştırıp birkaç soru sorun. İkinci adımda aynı modeli kendi kodunuzdan çağırın ve cevabı ekrana akış olarak yazdırın. Üçüncü adımda sistem talimatıyla modele bir rol verin ve çıktı biçimini sabitleyin; örneğin her zaman belirli alanları içeren kısa bir yapı istemek, uygulamanızı çok daha öngörülebilir kılar. Dördüncü adımda küçük bir belge koleksiyonuyla RAG kurun ve deneme sorularıyla ölçün. Beşinci adımda kullanıcı arayüzünü ve hata yönetimini düzeltin. Altıncı adımda gerçekten ihtiyaç duyuyorsanız görüntü üretimi ya da ince ayar ekleyin.

Her aşamada iki şeyi yapın: ne kadar VRAM kullandığınızı izleyin ve kendi örnek sorularınızla sonucu ölçün. VRAM kullanımını NVIDIA'da nvidia-smi ile, diğer platformlarda sistem izleme araçlarıyla görebilirsiniz. Ölçmeden yapılan iyileştirmeler çoğu zaman yanıltır. Son olarak, çalışan sürümünüzün hangi model ve hangi kuantizasyonla test edildiğini not edin; model güncellendiğinde davranış değişebilir ve geri dönmek gerekebilir.

Sık Sorulan Sorular

Ekran kartım yoksa yapay zeka uygulaması geliştiremez miyim?

Geliştirebilirsiniz. Küçük modeller işlemci ve RAM ile de çalışır, sadece daha yavaştır. Ayrıca geliştirme sırasında bulut API'lerini kullanıp daha sonra yerel modele geçebilirsiniz.

Hangi ekran kartı yapay zeka için en iyisi?

Tek bir doğru cevap yok; bütçeye ve hedefe bağlıdır. Genel kural olarak aynı fiyat bandında daha fazla VRAM'li kart tercih edilir ve araç desteği açısından NVIDIA en az sürprizli yoldur. Satın almadan önce kullanmak istediğiniz aracın desteklediği kartları kontrol edin.

8 GB VRAM yeterli mi?

Küçük ve orta ölçekli modellerle öğrenmek, 7-8B sınıfı bir modelle sohbet ve basit RAG denemeleri için kabaca yeterlidir. Daha büyük modeller, uzun bağlam ve ince ayar için sınırlayıcı olur.

Ollama ile LM Studio arasındaki fark nedir?

Ollama komut satırı ve API odaklıdır, geliştirici akışına uyar. LM Studio görsel arayüz sunar ve model keşfini kolaylaştırır. İkisi de yerel sunucu açabilir; sizin için hangisi rahatsa onu seçin, birlikte de kullanabilirsiniz.

Kuantizasyon kaliteyi çok düşürür mü?

Bit sayısı düştükçe kalite bir miktar azalır. 4 bit civarı çoğu günlük iş için makul bir denge sayılır; çok düşük bitlerde fark belirginleşir. Kendi sorularınızla iki sürümü karşılaştırmak en doğru yoldur.

RAG mı, ince ayar mı yapmalıyım?

Modelin kendi belgelerinizden bilgi kullanmasını istiyorsanız önce RAG. Üslup, çıktı biçimi veya dar bir davranışı değiştirmek istiyorsanız ince ayarı düşünün. İkisi birlikte de kullanılabilir.

Evdeki kartla sıfırdan model eğitebilir miyim?

Öğrenme amacıyla çok küçük modeller eğitilebilir, ancak kullanışlı genel amaçlı bir dil modelini sıfırdan eğitmek evdeki donanımla gerçekçi değildir. Hazır modeli uyarlamak (LoRA/QLoRA) çok daha pratik bir yoldur.

AMD kartım var, kullanabilir miyim?

Çoğu zaman evet, ama destek karta, sürücüye ve işletim sistemine göre değişir. Ollama ve llama.cpp belgelerindeki desteklenen donanım listesini kontrol edin. Eğitim araçlarında NVIDIA kadar rahat olmayabilirsiniz.

Mac'imde yapay zeka uygulaması geliştirebilir miyim?

Evet. Apple Silicon'da birleşik bellek sayesinde görece büyük modeller çalışabilir; Ollama, LM Studio, llama.cpp ve MLX gibi araçlar Metal desteğiyle kullanılabilir. Eğitim tarafı CUDA kadar olgun değildir.

Yerel modeller bulut modelleri kadar iyi mi?

Genelde en büyük bulut modelleri daha yeteneklidir. Yine de dar ve iyi tanımlanmış görevlerde, özellikle RAG ile desteklenmiş küçük yerel modeller yeterli olabilir. Kritik işlerde çıktıyı doğrulayın.

Yaptığım uygulamayı satabilir miyim?

Kullandığınız modelin ve verinin lisansına bağlıdır. Bazı modeller ticari kullanıma izin verir, bazıları kısıtlar. Satıştan önce lisansı okuyun, gerekirse hukuki destek alın.

Kart sürekli çalışırsa ömrü kısalır mı?

Aşırı ısınma ve kötü soğutma donanım için risklidir. Sıcaklığı güvenli aralıkta tutar ve toz temizliğini yaparsanız normal kullanım koşullarında endişe gerektirecek bir durum beklenmez; kesin garanti vermek mümkün değildir.

#yerel yapay zeka #ekran kartı VRAM #Ollama #LoRA ince ayar #RAG
Takipox
Takipox

Takipox; Instagram, TikTok, YouTube, WhatsApp ve diğer platformlarda karşılaşılan hesap, erişim ve güvenlik sorunları ile dijital pazarlama üzerine adım adım çözüm rehberleri hazırlar.

Yorumlar (0)

Yorum Yaz

E-postanız yayınlanmaz.
0/1000

Henüz yorum yapılmamış. İlk yorumu siz yapın!

Size Nasıl Yardımcı Olalım?

Destek kanallarımızdan birini seçin