

Yapay zekâ uygulamalarını ölçeklendirme
Çalışan bir model ile hizmet veren bir sistem aynı şey değildir. Ölçeklendirme; eş zamanlı istekleri karşılayan, izlenebilen ve büyüdükçe düğüm eklenebilen bir altyapı gerektirir.
AI ölçekleme iş akışları için donanım çözümlerimiz
Üretimdeki yapay zekâ iş yükü iki farklı karaktere ayrılır. Çıkarım (inference) tarafında ölçü, saniyedeki istek sayısı ve ilk çıktıya kadar geçen gecikmedir; eğitim tarafında ise bir çevrimin (epoch) ne kadar sürdüğü. Bu iki hedef farklı yapılandırmalar ister — aynı sunucuyu her ikisi için birden zorlamak genelde ikisini de yavaşlatır.
Çıkarımda ekran kartı belleği, aynı anda kaç isteğe hizmet verebileceğinizi belirler. Model ağırlıkları bir kez yüklenir, kalan bellek eş zamanlı isteklerin bağlam verisine ayrılır; bellek arttıkça toplu işleme (batching) verimliliği ve dolayısıyla sunucu başına düşen kullanıcı sayısı artar. Sekiz GPU taşıyan bir MGX sunucu, tek kullanıcı için hızlı olmaktan çok, çok sayıda kullanıcıya aynı anda yetişmek için vardır.
Çok düğümlü eğitimde darboğaz genellikle hesaplama değil, ağdır. Düğümler her adımda gradyan alışverişi yapar; standart ağ üzerinde bu alışveriş hesaplamadan uzun sürebilir ve kart ekledikçe kazanç düşer. Bu yüzden ölçeklenen kurulumlarda yüksek bant genişlikli düğümler arası bağlantı, kart sayısı kadar önemlidir.
Süreklilik ve yönetilebilirlik de ölçeğin parçasıdır. Uzaktan yönetim (IPMI/BMC) olmadan fiziksel erişim gerektiren her arıza, hizmet kesintisine dönüşür; yedekli güç ve rack’e uygun ısıl tasarım ise sistemin gece boyunca çalışmasını sağlar. HELIXX sunucular bu gereksinimlerle birlikte yapılandırılır.
Bu sayfa BOXX Türkiye tarafından hazırlanmıştır. Donanım gerekçeleri sektörde yerleşik teknik bilgiye dayanır; ürün eşleştirmeleri kataloğumuzdaki gerçek sistem verilerinden alınmıştır. Yapılandırmanızı birlikte netleştirmek için bize yazın.
AI ölçekleme iş akışları için sistemler
NVIDIA RTX PRO MGX platformu üzerine kurulu, dört ve sekiz GPU’lu sunucu yapılandırmaları.


