Ajan Yapay Zeka Çağının Mimarisini Tasarlamak: Yerel Hermes 3 Orkestrasyonu, Kıyaslama Testleri ve Hata Ayıklama

Rind Devran Tukan
Rind Devran Tukan
Yayınlanma: •Güncelleme: •8 dakika okuma
AI generated image for agentic ai era

Son birkaç yıldır yapay zekayla olan ilişkimiz son derece işlemsel oldu. Bir istem yazıyoruz, model bir yanıt üretiyor ve döngü sona eriyor. Bu "tek istemli yürütme" modeli, etkileyici olmakla birlikte, planlama, doğrulama ve yürütmenin tüm bilişsel yükünü insan kullanıcının omuzlarına yüklüyor. Agentic AI dönemi, bu paradigmadan köklü bir kopuşu temsil ediyor. Sürekli yönlendirilme gerektiren pasif sistemlerden, otonom yineleme yeteneğine sahip aktif, hedef odaklı yazılımlara doğru ilerliyoruz.

Bu yeni dönemde değer birimi, içerik üretiminden iş akışı yürütmeye kayıyor. Bir LLM'den "bu verilere dayanarak bir satış raporu yazmasını" istemek yerine, agentic bir sisteme daha üst düzey bir hedef verilir: "3. çeyrekteki müşteri kaybımızı analiz et, kök nedenleri belirle ve risk altındaki hesaplara yönelik hedefli e-posta kampanyaları başlat." Bunu başarmak için agentic sistemler üç temel mimari sütuna dayanır:

  • Dinamik Planlama: Karmaşık ve belirsiz bir hedefi sıralı kilometre taşlarına bölme ve yeni veri noktaları ortaya çıktıkça izlenecek yolu uyarlama yeteneği.
  • Araç Entegrasyonu: Veritabanlarından okuma yaparak, API'leri çağırarak ve güvenli korumalı alanlarda kod yürüterek fiziksel ve dijital dünyayla etkileşime girme kapasitesi.
  • Öz-Yansıtma: Nihai sonucu bir insana sunmadan önce hataları düzeltmek amacıyla ara çıktıları önceden tanımlanmış koruma sınırlarına göre değerlendirmek ve dahili geri bildirim döngüleri çalıştırmak.

İstem Yazımından Orkestrasyona Geçiş

Teknoloji liderleri için bu geçişe hazırlanmak, yazılımları geliştirme ve dağıtma şeklimizi tamamen gözden geçirmeyi gerektiriyor. Artık kritik beceri istem mühendisliği değil; orkestrasyon mühendisliğidir. İşletmeler "mükemmel istemi" oluşturmaya çalışmaktan vazgeçmeli ve bunun yerine sağlam durum yönetimi sistemleri tasarlamaya, net araç kullanım sınırları belirlemeye ve katı operasyonel koruma sınırları oluşturmaya odaklanmalıdır.

Zihinsel modelinizi bir yazılım aracını yönetmekten dijital bir iş gücünü yönlendirmeye kaydırarak, gerçek operasyonel ölçeklenebilirliğin kapılarını aralarsınız. Agentic AI döneminin amacı ekibinizin daha hızlı yazmasına yardımcı olmak değil; arka planda otonom olarak karmaşık, çok adımlı süreçleri yürüten sistemler tasarlayarak insan uzmanlarınızın stratejik karar almaya ve istisnai durumları yönetmeye odaklanmasını sağlamaktır.

Tek komut istemli (single-prompt) etkileşimlerden gelişmiş etmen tabanlı (agentic) iş akışlarına geçiş yaparken, temel dil modeli seçimi sistemin üst sınırını belirler. Hermes 3, bu mimariler için bir güç merkezi olarak ortaya çıkmıştır. Standart dışı talimatlara genellikle direnen, sıkı korunan ticari API'lerin aksine Hermes 3; yapılandırılmış çıktı üretimi, rol yapma tutarlılığı ve uzun bağlam muhakemesi konularında üstünlük sağlayarak LangGraph ve CrewAI bünyesindeki uzmanlaşmış etmenlere güç vermek için ideal motor haline gelmektedir.

LangGraph ile Durumlu Karar Döngüleri

LangGraph, durum kalıcılığının kritik olduğu karmaşık, döngüsel etmen davranışlarını modellemede üstündür. Bu kurulumda Hermes 3, merkezi yönlendirici ve yürütücü olarak görev yapar. Üstün işlev çağırma (function-calling) yetenekleri sayesinde genel durum grafiğini analiz edebilir, hangi aracın çağrılacağına karar verebilir ve bağlamı kaybetmeden durumlar arası geçiş yapabilir. Son derece etkili bir tasarım deseni, Hermes 3'ü alt etmenlerin çıktısını değerlendiren ve grafik yürütmesini dinamik olarak yönlendiriren bir supervisor node (gözetmen düğüm) olarak kullanmaktır. Tarafsız hizalaması, sistemin uç durum girdilerinde takılıp kalmasını önleyerek kesintisiz durum geçişleri sağlar.

CrewAI'da Rol Tabanlı İş Birliği

LangGraph karmaşık durum makinelerini yönetirken, CrewAI rol yapma ve görev odaklı delegasyonda öne çıkar. Hermes 3, farklı veri kümeleri üzerindeki derin eğitimi sayesinde CrewAI için benzersiz bir uyuma sahiptir; bu da onun uzun etkileşimler boyunca kişilik sapması yaşamadan belirli personaları benimsemesini sağlar. Bu entegrasyonu en üst düzeye çıkarmak için geliştiricilerin birkaç temel stratejiyi benimsemesi gerekir:

  • Yönlendirilebilirlikten Yararlanın: Her bir ekip üyesi için son derece uzmanlaşmış, belirgin personalar tanımlamak amacıyla Hermes 3'ün gelişmiş sistem istemi uyumluluğundan faydalanın.
  • Yerel Gecikme Süresini Optimize Edin: Etmenlerin bir görevi çözmek için tekrar tekrar konuşması gerektiğinde kritik önem taşıyan ağ gecikmesini ortadan kaldırmak için Hermes 3'ü Ollama veya vLLM gibi çerçeveleri kullanarak yerel olarak konuşlandırın.
  • Sıkı JSON Çıktılarını Zorunlu Kılın: Etmenler arasında kusursuz veri aktarımı sağlamak için CrewAI'ın yapılandırılmış çıktı ayrıştırıcısını Hermes 3'ün yerel JSON biçimlendirme yetenekleriyle birlikte kullanın.

Mühendislik ekipleri, LangGraph ve CrewAI'ın yapısal disiplini ile Hermes 3'ün bilişsel esnekliğini bir araya getirerek, yüksek yürütme sadakati ve minimum operasyonel yük ile çalışan dayanıklı, otonom sistemler inşa edebilirler.

Ajanlar çağında, hesaplamanın birim ekonomisi değişti. Artık doğrusal sorgu-ve-yanıt uygulamaları oluşturmuyoruz; çok turlu yürütme döngülerinde düşünen, kendi kendini düzelten ve araçları çağıran otonom ajan döngüleri inşa ediyoruz. Bu paradigmada, tek bir kullanıcı talebi düzinelerce dahili model çağrısını tetikleyebilir. Token-gecikme süresi mutabakatı, kurumsal yapay zeka için belirleyici mimari kısıt haline tam olarak burada gelir. Defterin bir tarafında GPT-4o ve Claude 3.5 Sonnet gibi ticari öncü modeller yer alıyor. Eşsiz bir bilişsel derinlik sunuyorlar ancak ağır bir bedeli de beraberinde getiriyorlar: ağ gecikmesi, kuyruk gecikmeleri ve katlanan API maliyetleri. Bir ajanın karmaşık bir görevi çözmek için on beş muhakeme adımına ihtiyacı varsa, ticari bir API on beş ağ gidiş-dönüşü getirir. Hızlı akış olsa bile bu durum hantal, sinir bozucu bir kullanıcı deneyimi ve son derece öngörülemez bir aylık fatura ile sonuçlanır. Diğer tarafta ise Nous Hermes gibi açık ağırlıklı modellerle somutlaşan yerel alternatif yer alıyor. vLLM gibi optimize edilmiş çıkarım motorları kullanılarak çıplak metal veya özel bulut örneklerinde barındırıldığında yerel Hermes, performans profilini dönüştürür.

Ajan İç Döngüsünü Optimize Etmek

Duyarlı ve uygun maliyetli ajanlar oluşturmak için mühendislik ekiplerinin, ajanların "iç döngüsünü" "dış döngüsünden" ayırması gerekir.
  • İç Döngü (Yerel Hermes): Durum takibi, temel araç yönlendirme ve yapısal JSON üretimi gibi yüksek frekanslı görevler için yerel, yüksek işlem hacimli modeller kullanın. Özel yerel silikon üzerinde Hermes benzeri bir modeli çalıştırmak, 100 ms'nin altında ilk token süresi (TTFT) sağlayarak ajanın yürütme döngüsünü hızlı ve bütçe dostu tutar.
  • Dış Döngü (Ticari Öncüler): Pahalı ticari API'leri yalnızca yüksek belirsizlik içeren sentezler, kritik stratejik kararlar veya son aşama kullanıcı teslimatları için saklayın.
Tekrarlayan, yapısal mantığı ince ayarlı yerel bir Hermes örneğine devrederek, gecikme süresini kökten düşürür ve değişken API maliyetlerini ortadan kaldırırsınız. Amaç birini diğerine tercih etmek değil; yerel hesaplamanın operasyonel yükü üstlendiği, ticari öncülerin ise özel eskalasyon noktaları olarak işlev gördüğü hibrit bir mutabakat yürütmektir.

İç Monoloğu Ayrıştırma: XML Etiketleriyle Ajan Sapmasını Hata Ayıklama

Ajan çağında otonomi nihai hedeftir, ancak kritik bir zafiyeti de beraberinde getirir: ajan sapması. Otonom LLM ajanları çok adımlı iş akışlarını yürütürken kaçınılmaz olarak anlamsal gürültü biriktirirler. İkinci adımdaki hafif bir uyumsuzluk onuncu adıma gelindiğinde katlanarak büyür ve ajanı kullanıcının asıl amacından uzak, halüsinasyonlarla dolu bir çıkmaza sürükler. Bu bilişsel entropiyi evcilleştirmek için, ajanın içsel muhakemesini —yani iç monoloğunu— otomatik denetim için açığa çıkarmalı ve yapılandırmalıyız.

Yapılandırılmamış düşünce zinciri (chain-of-thought) yönlendirmesi kullanmak, kurumsal düzeyde gözlemlenebilirlik için artık yeterli değildir. Bunun yerine, lider mühendislik ekipleri XML ile sarmalanmış muhakeme durumlarını standart hale getiriyor. Ajanı, bilişsel aşamalarını <planning>, <execution> ve <reflection> gibi açık etiketlerle sarmalamaya zorlayarak, temiz ve makine tarafından ayrıştırılabilir bir denetim izi oluşturuyoruz. Bu sadece günlük kaydı tutmaktan ibaret değildir; gerçek zamanlı çalışma zamanı doğrulaması için hayati bir mekanizmadır.

Bir ajanın iç monoloğu XML aracılığıyla yapılandırıldığında, orkestrasyon motorunuz sapmayı, maliyetli bir API çağrısına veya geri döndürülemez bir veritabanı yazma işlemine dönüşmeden önce programatik olarak engelleyebilir. Bu mimari, üç güçlü hata ayıklama şablonu sağlar:

  • Aktif Durum Doğrulaması: Ajanın temel kısıtlamalarından sapmadığından emin olmak için <planning> bloğu içindeki içeriği ayrıştırın ve orijinal sistem komutuna karşı anlamsal benzerlik kontrolleri çalıştırın.
  • Sezgisel Tabanlı Müdahale:<reflection> içindeki içerik yüksek belirsizlik gösteriyorsa veya ardışık adımlarda tekrarlayan döngüler tespit edilirse, bir yedek işleyiciyi tetikleyin veya görevi insan denetimli doğrulamaya yönlendirin.
  • Sözdizimsel Güvenilirlik: LLM'lerin kaçış karakteri kullanılmamış tırnak işaretleri içeren uzun doğal dil çıktıları üretirken sıkça bozduğu JSON'ın aksine, XML etiketleri son derece dayanıklıdır ve regex veya hafif ayrıştırıcılar kullanılarak kolayca izole edilebilir.

Otonom sistemlerde hata ayıklamak, kara kutunun ne düşündüğünü tahmin etmeye çalışmak gibi hissettirmemelidir. XML etiketli iç monologları zorunlu kılarak, deterministik olmayan sistemlere deterministik bir pencere açar, sessiz hataları yapılandırılmış ve hata ayıklanabilir telemetri verilerine dönüştürürsünüz.

Yerel bir konsept kanıtından kurumsal düzeyde bir etmen tabanlı sisteme geçiş yapmak acı bir gerçeği ortaya koyuyor: Bir geliştiricinin dizüstü bilgisayarında çalışan orkestrasyon modelleri, üretim yükleri altında başarısız olur. Bir geliştirme ortamında, yerel orkestratörler genellikle etmen durumunu, belleğini ve araç yürütmesini süreç içinde yönetir. Üretimde ise bu sıkı bağlantı, tek hata noktaları oluşturur, yatay ölçeklendirmeyi engeller ve sistem yeniden başlatmaları sırasında büyük ölçekli durum kayıpları riski yaratır.

Etmen Durumunu ve Belleğini Dışsallaştırmak

Bu yerel orkestratörleri ölçeklendirmek için öncelikle yürütmeyi durumdan ayırmalısınız. Etmen çalışma zamanlarınızı durumsuz mikro hizmetler olarak ele alın. Sohbet belleğini, planlama durumlarını ve yürütme geçmişlerini Redis veya PostgreSQL gibi yüksek verimli, dayanıklı harici depolara aktarın. Bu durumu dışsallaştırarak, Kubernetes kullanarak orkestrasyon konteynerlerinizi yatay olarak ölçeklendirebilir ve bir konteyner çalışma sırasında yeniden planlanırsa, başka bir düğümün etmenin yürütme yolunu son araç çağrısının tam kontrol noktasından anında devam ettirmesini sağlayabilirsiniz.

Dayanıklı, Olay Güdümlü Orkestrasyona Geçiş

Senkron API kalıpları, doğası gereği uzun süren ve öngörülemeyen etmen iş akışları için uygun değildir. Tek bir kullanıcı sorgusu; birden fazla sıralı araç yürütmesini, veri sorgusunu ve akıl yürütme adımını tetikleyebilir. HTTP bağlantılarını açık tutmak yerine, orkestratörlerinizi Apache Kafka veya RabbitMQ gibi mesaj kuyruklarını kullanan olay güdümlü bir mimariye geçirin. Ayrıca, dayanıklı yürütme kalıplarını benimseyin. Etmen grafiğindeki her bir "adımın" durumunu kalıcı hale getirerek, bir üst akış LLM veya üçüncü taraf API geçici bir kesinti yaşadığında maliyetli ve zaman alıcı geri almaların önüne geçersiniz.

Merkezi Geçit Hızı Sınırlama

Otonom etmenlerden oluşan bir filo, üst akış LLM belirteç kotalarınızı ve hız sınırlarınızı hızla tüketerek kurum genelinde zincirleme hatalara yol açabilir. Bunu önlemek için, yerel orkestratörleriniz ile model sağlayıcılarınız arasında merkezi bir yapay zeka geçidi uygulayın. Bu geçit şunları yönetmelidir:

  • Kritik, kullanıcıya yönelik etmenleri arka plandaki analitik çalışanlara göre önceliklendirmek için belirteç kovası hız sınırlaması.
  • Özdeş, tekrarlayan alt görevlerde maliyetli LLM akıl yürütme adımlarını yeniden çalıştırmaktan kaçınmak için akıllı önbelleğe alma katmanları.
  • Birincil ticari uç noktalar trafiği kısıtladığında istekleri otomatik olarak daha küçük, yerel açık kaynaklı yedek modellere yönlendirmek gibi kademeli hizmet düşürme stratejileri.