ozan özdil

Günlük +
26 Ağustos 2026 Çarşamba Omarchy, LM Studio, intel arc b580 ve sonraki projeler

Omarchy 4.0 ve LLM Çıkarım Altyapısı: Yerel Edge AI Mimarisi

Büyük Dil Modelleri'nin (LLM) bulut tabanlı servislerden yerel donanımlara (Edge AI) taşınması, hem gizlilik hem de gecikme (latency) optimizasyonu açısından kritik bir paradigma değişimi temsil etmektedir. Bu yazıda, Omarchy 4.0 işletim sistemi tabanında kurulan bu altyapıyı, kullanılan donanım bileşenlerinin bilimsel gerekçelerini ve yazılım mimarisinin LLM çıkarım (inference) süreçlerindeki rolünü derinlemesine inceleyeceğiz.

Yerel Yapay Zeka ve Edge AI Altyapısı

1. İşletim Sistemi Çekirdeği: Omarchy 4.0

Omarchy, Linux tabanlı işletim sistemlerinin (özellikle Fedora/Arch türevleri) sunmuş olduğu modüler yapıyı, yapay zeka geliştiricileri için deterministik ve stabil bir hale getiren bir derlemedir. 4.0 sürümünde, GPU sürücülerinin (özellikle Intel ve AMD platformları için) çekirdek seviyesindeki entegrasyonu optimize edilmiştir.

Bu mimari, LLM modellerinin çalıştırılmasında kernel scheduling (çekirdek zamanlaması) ve PCIe bus (veri yolu) yönetimini doğrudan etkiler. Omarchy'nin sunduğu paket yönetimi, llama.cpp veya ExLlama gibi çıkarım motorlarının bağımlılıklarının (CUDA/ROCm/ZLUDA) çatışmasız bir şekilde derlenmesini sağlar.

Linux Terminalinde Kod Derleme ve Yapılandırma

2. Donanım Substratı: Intel B580 Seçiminin Bilimsel Gerekçesi

LLM çıkarım işlemi (inference), hesaplama gücünden (FLOPS) ziyade Bellek Bant Genişliği (Memory Bandwidth) ve Veri Tipi Dönüşümü (FP16/INT8) verimliliğine bağlıdır. Bu noktada Intel B580'in tercih edilmesinin arkasında yatan mühendislik gerekçeleri şunlardır:

  • Xe-HPG Mimarisi ve Matris Operasyonları: B580, Intel'in en güncel Xe-HPG (High Performance Graphics) mimarisini kullanır. Bu mimari, LLM'lerin temelini oluşturan Matris-Çarpım (GEMM) işlemlerini hızlandıran donanımsal birimlere (Tensor Core benzeri) sahiptir.
  • Bellek Verimliliği (VRAM Management): LLM'lerde her bir token üretimi, model ağırlıklarının (weights) VRAM'den okunmasını gerektirir. B580'in yüksek bant genişliği, özellikle INT8 ve FP16 kuantizasyonlarında veri şişkinliğini (bottleneck) en aza indirir.
  • Açık Kaynak Ekosistem Uyumu: Intel'in oneCCL ve SYCL gibi açık kaynaklı yazılım kütüphaneleri, LM Studio gibi arayüzlerin altındaki llama.cpp motoruyla entegre çalışarak, NVIDIA CUDA'ya bağımlılığı kırar.
Intel Arc GPU Donanım Altyapısı

3. Ölçeklenebilirlik ve Gelecek: Çoklu ARC Pro B70 Entegrasyonu

Yerel LLM altyapılarının asıl sınırı, model parametre sayısının (7B, 13B, 70B+) ve bağlam penceresi (Context Window) büyüklüğünün artmasıyla VRAM kapasitesinin yetersiz kalmasıdır. Bu darboğazı aşmak için mimarimizi çoklu GPU (Multi-GPU) ölçeklenmesine evriltmek planlanmaktadır.

Önümüzdeki günlerde, sisteme çoklu "ARC Pro B70" hızlandırıcı kartı entegre edilecektir. Bu yükseltmenin teknik hedefleri:

  • Tensor Parallelism (Tensör Paralelliği): B70 kartlarının PCIe 4.0 x16 hatları üzerinden birbirine bağlanarak, devasa model ağırlıklarının (weights) birden fazla GPU arasında dağıtılması.
  • Context Window Genişletme: Tek bir kartta sığmayan 128K veya 256K token'lık bağlam pencerelerinin, B70 dizisinin toplam VRAM havuzu sayesinde sorunsuzca işlenmesi.
  • Parallel Inference: Farklı kullanıcı isteklerinin aynı anda (batching) farklı GPU'lara yönlendirilerek yerel bir sunucu gibi yüksekThroughput (verimlilik) elde edilmesi.
Çoklu GPU ve Yüksek Yoğunluklu Sunucu Altyapısı

4. Çıkarım Motoru ve Yönetim: LM Studio

Sistemin kullanıcı arayüzü ve model yönetim katmanı olarak LM Studio tercih edilmiştir. LM Studio, yalnızca bir arayüz değil, aynı zamanda yerel bir REST API sunucusu olarak çalışır. Bu, geliştirilen diğer uygulama katmanlarının (Frontend/Backend) yerel LLM ile JSON formatında haberleşmesini sağlar.

llama.cpp tabanında çalışan LM Studio, AWQ ve GPTQ kuantizasyonlarını destekleyerek, Intel B580 gibi donanımlarda model boyutunu %50-70 oranında küçültür. Bu işlem, modelin zeka seviyesini (intelligence) minimal düzeyde düşürerek, inference hızını katlayarak artırır.

Nöral Ağ Veri İşleme Algoritmaları

Sonuç

Omarchy 4.0, Intel B580 ve LM Studio üçgeni, yerel yapay zeka geliştirme için deterministik, yüksek verimli ve açık kaynaklı bir platform sunmaktadır. Planlanan ARC Pro B70 dizisi entegrasyonu, bu altyapıyı "kişisel bir LLM terminali" olmaktan çıkarıp, kurumsal düzeyde Yerel Bir AI Kümesi (Local AI Cluster) seviyesine taşıyacaktır.


*Not: Bu makalede kullanılan görseller temsilidir. Donanım spesifikasyonları, Intel'in güncel teknik dokümanlarına ve LM Studio'nun GitHub repository'sine dayanmaktadır.*

Fotoğraf Arşivi +
Albümler yükleniyor...
FLICKR ARŞİVİ
Hakkımda +

Profesyonel Özgeçmiş

Mühendis olarak teknik projeler, sistem mimarileri ve dijital dönüşüm süreçlerinde aktif rol alıyorum. 2008–2012 yılları arasında kafe işletmeciliği yaptım, 2012–2017 döneminde freelance projelerde çalıştım. 2018–2019’da Özdemir Mühendislik’te görev aldıktan sonra, 2019’dan bu yana Kastamonu Belediyesi bünyesinde çeşitli pozisyonlarda (Başkan Danışmanı, Ar-Ge Müdürü, Bilgi İşlem Müdürü, Basın Müşaviri ve Mühendis) sorumluluk üstlendim. Yerel ve uluslararası projelerde imzam bulunuyor.

Uzmanlık Alanları

Siber güvenlik, veri gizliliği ve açık kaynak sistemlerin güvenliği üzerine çalışıyorum. Açık bulut çözümleri (TrueNAS, NextCloud, SyncThing, OpenCloud) ile projeler geliştiriyor, CachyOS ve GrapheneOS gibi sistem mimarilerini optimize ederek iş akışlarıma entegre ediyorum.

Fotoğraf ve Prodüksiyon

Lisanslı drone pilotu olarak video ve fotoğraf çekimleri yapıyor, Fujifilm GFX 100 ve GFX 50R orta format makinelerle profesyonel projeler yürütüyorum. Prodüksiyon süreçlerinde DaVinci Resolve Studio ve Final Cut Pro kullanarak yüksek kaliteli içerikler üretiyorum. Fotoğraf projelerim kültürel ve tarihi dokuyu görsel anlatılarla belgelemeye odaklanıyor.

Araştırma ve Gelişim

Açık kaynak yazılımları araştırıyor, dijital vatan, siber savunma ve yapay zekâ konularında okur-yazarlık geliştiriyorum. Teknoloji ve fotoğrafçılığı bir araya getirerek hem teknik hem sanatsal üretimlerde bulunuyorum.

Siber Güvenlik Veri Gizliliği Dijital Vatan Yapay Zekâ Açık Kaynak TrueNAS SCALE NextCloud SyncThing OpenCloud CachyOS GrapheneOS Drone Pilotluğu Havadan Çekim Fujifilm GFX 100 Fujifilm GFX 50R Orta Format DaVinci Resolve Final Cut Pro Video Prodüksiyon Kültürel Belgeleme Ar-Ge Yönetimi Bilgi İşlem Basın ve İletişim Elektronik Güvenlik Belediye Projeleri
İletişim +