Microsoft ThinkingBox, Hugging Face’te: AI ajanlarının güvenilirliği nasıl ölçülüyor?
- Ekim 4, 2026
- Yapay Zeka
Microsoft ve Hugging Face, ThinkingBox’ın OpenEnv üzerinden kullanılmasını 3 Ekim 2026 tarihli ortak yazıyla duyurdu. Sistem, yapay zekâ ajanlarının yalnızca verdiği cevapları değil, işlem sonunda veritabanında bıraktığı kayıtları ve aynı görevi tekrar tekrar doğru tamamlayıp tamamlayamadığını değerlendiriyor.
Gelişme, işletmelerde AI ajanlarının kullanımına ilişkin önemli bir soruya odaklanıyor: Bir ajan işi tamamladığını söylüyorsa, gerekli işlemler gerçekten doğru yapılmış mı? ThinkingBox, bu sorunun yanıtını konuşma metninden ziyade sistemde oluşan sonuçlarda arıyor.
Ortak duyurunun yeni unsuru, değerlendirme ortamının Hugging Face ve OpenEnv üzerinden erişilebilir hâle gelmesi. Temel araştırma ise daha önce yayımlandı: ThinkingBox makalesi ilk olarak 20 Ağustos 2026’da arXiv’e sunuldu; son revizyonu 1 Ekim 2026 tarihini taşıyor.
ThinkingBox nedir, neyi test ediyor?
ThinkingBox, büyük dil modellerinin araç kullanarak iş yaptığı senaryoları test etmek için geliştirilen açık kaynaklı bir çerçeve. Araçları Model Context Protocol (MCP) uyumlu sunucular üzerinden sunabiliyor; ajan, bu araçlarla ve simüle edilen kullanıcıyla etkileşime giriyor.
Microsoft’un proje deposunda çerçevenin senaryo oluşturma, izole araç ortamlarını başlatma, ajanı çalıştırma ve sonuçlarını değerlendirme işlevleri açıklanıyor. ThinkingBox’ın kendisi yeni bir sohbet modeli değil; modellerin ve ajanların davranışını incelemek için kullanılan bir test altyapısı.
Bu altyapı üzerinde çalışan ThinkingBox-Bench, 507 iş akışından oluşuyor. Araştırmada perakende, konaklama, otomobil sigortası, neobankaların kurum içi BT süreçleri ve danışmanlık şirketlerinin BT/insan kaynakları desteği gibi alanlar ele alınıyor.
Doğru cevap vermek, doğru işlem yapmak anlamına gelmiyor
Bir AI ajanı, araçları geçerli biçimde çağırıp ikna edici bir yanıt üretse bile yanlış kaydı değiştirebilir, gerekli işlemi eksik bırakabilir veya istenmeyen ek değişiklikler yapabilir. ThinkingBox bu nedenle işlem sonunda oluşan sistem durumunu, görevin gerektirdiği sonuçla karşılaştırıyor.
Örneğin bir destek kaydının açık tutulması gerekiyorsa, ajanın müşteriye düzgün bir açıklama yapması kaydın yanlışlıkla kapatılmasını telafi etmez. Başarı değerlendirmesinde hem yapılması gereken değişiklikler hem de yapılmaması gereken işlemler önem taşır.
Araştırmanın yaklaşımı, farklı işlem yollarını kabul ederken yanlış, eksik veya fazladan etkileri reddeden çalıştırılabilir kontroller kullanıyor. Bazı görevlerde son yanıtın gerekli bilgileri içerip içermediği de ayrıca değerlendiriliyor.
Tek başarı ile tutarlılık nasıl ayrılıyor?
Ortak duyuruda her görevin aynı başlangıç durumundan 20 bağımsız kez çalıştırıldığı belirtiliyor. Sonuçlar üç ayrı ölçümle ele alınıyor:
- pass@1: Denemelerin genelinde tek denemelik başarı düzeyini gösteriyor.
- pass@20: Bir görevin 20 denemede en az bir kez çözülebilmesini ölçüyor.
- Gözlenen 20/20 başarı: Kaydedilen 20 denemenin tamamında başarılı olunan görevleri gösteriyor.
Bu ayrım, ara sıra doğru sonuç veren bir ajanla aynı işi tutarlı biçimde tamamlayan bir ajanın farklı değerlendirilmesini sağlıyor. Bununla birlikte 20 denemede başarı, gelecekteki her işlem için hatasızlık garantisi değildir.
Hugging Face ve OpenEnv bağlantısı ne sağlıyor?
OpenEnv dokümantasyonuna göre ThinkingBox bağlantısı, benchmark görevlerini standart bir arayüz üzerinden çalıştırmayı sağlıyor. Mevcut adaptör değerlendirme amaçlı tasarlanmış durumda; tamamlanan görevler için başarılı veya başarısız sonucunu döndürüyor.
Hugging Face üzerindeki ThinkingBox-Bench veri sayfası, görevleri incelemeyi kolaylaştırıyor. Çalıştırılabilir benchmark varlıklarının kaynağı ise GitHub’daki sürümlenmiş veri deposu.
Bu erişim, bütün sistemi tarayıcıdan tek tıkla çalıştıran hazır bir hizmet anlamına gelmiyor. Dokümantasyon; araç sunucuları, ThinkingBox oturum altyapısı, Typesense ve gerekli model uç noktalarının ayrıca hazırlanmasını gerektiriyor.
İşletmeler için neden önemli?
Editoryal değerlendirme: AI ajanları müşteri kayıtlarını, destek taleplerini veya kurum içi işlemleri değiştirmeye başladığında, kaliteli bir yanıt metni başarıyı ölçmek için yetersiz kalabilir. İşletmelerin, otomasyonun gerçekten hangi kaydı değiştirdiğini ve sonucu tekrar eden işlemlerde koruyup koruyamadığını izleyebilmesi gerekir.
Türkiye’de ajan tabanlı otomasyon geliştiren ekipler açısından da aynı ayrım geçerli: Model seçimini yalnızca başarılı bir gösterime dayandırmak yerine, işletmeye özgü görevlerle tekrar eden testler yapmak daha anlamlı bir değerlendirme sağlayabilir. Araç kullanan ajanların uygulama ve güvenlik boyutuna ilişkin örnekler için SAM Medya’nın Clawdbot rehberi incelenebilir.
ThinkingBox sonuçlarının sınırı da açık tutulmalı. Kamuya açık benchmark, gerçek iş süreçlerini örnek alan sentetik senaryolardan oluşuyor; gerçek müşteri işlemlerinin ölçümü değil. Yayımlanan sonuçlar araştırmacıların deneylerini yansıtıyor ve her işletmenin kendi sistemindeki performansı doğrudan belirlemiyor.
Kaynaklar
Yorum yap cancel
Biz kimiz?
Tam hizmet dijital pazarlama ajansımız, işletmenizin tüm dijital pazarlama ihtiyaçlarını karşılayan kapsamlı çözümler sunar.
Bizimle iletişime geçin
Web sitelerinin organik arama skorlarını büyük ölçüde artırarak, yoğun rekabetin olduğu anahtar kelimelerde dahi en üst sıralarda yer almanızı sağlayan profesyonel SEO hizmetlerimizi sunuyoruz.







