Samsung Electronics, yapay zekâ verimliliğini ölçmek adına Samsung Research tarafından geliştirilen özel benchmark çözümü TRUEBench’i (Trustworthy Real-world Usage Evaluation Benchmark) duyurdu. Bu araç, büyük dil modellerinin iş dünyasındaki gerçek senaryolardaki performansını kapsamlı bir metrik setiyle değerlendirir. Gerçekçi bir değerlendirme için çeşitli diyalog senaryoları ve çok dilli koşulları kullanır. TRUEBench, kurumsal görevlerin geniş bir yelpazesini kapsayacak şekilde içerik oluşturma, veri analizi, özet çıkarma ve çeviri gibi işlevleri 10 ana kategori ve 46 alt kategori altında inceleyerek güvenilir bir puanlama sağlar. Yapay zekâ destekli otomatik değerlendirme süreçleri, insan ve yapay zekâ iş birliğiyle tasarlanan kriterlere dayanır ve böylece gerçek çalışma verimliliğini ölçer.Samsung Electronics Dijital Deneyimler CTO’su ve Samsung Research Başkanı Paul (Kyungwhoon) Cheun, “Gerçek dünyadaki yapay zekâ deneyimleriyle müşterilerimize güçlü bir uzmanlık ve rekabet avantajı sunuyoruz. TRUEBench’in üretkenlik alanında standartlar belirlemesi ve Samsung’un liderliğini pekiştirmesi bekleniyor” dedi.Günümüzde şirketler yapay zekâyı daha yaygın biçimde benimserken, büyük dil modellerinin üretkenliğini ölçmeye yönelik talep artıyor. Ancak mevcut kriterler çoğunlukla İngilizce odaklı olup tek tur soruyla sınırlı bir genel performans değerlendirmesi sunuyor. Bu durum, gerçek çalışma ortamlarını yansıtma konusunda yetersiz kalabiliyor. TRUEBench bu sınırlamaları aşmak amacıyla 10 kategori ve 12 dilde çalışan 2.485 test seti sunar ve dil arası senaryoları destekler. Test setleri, yapay zekâ modellerinin gerçek dünyadaki çözüm becerilerini kapsamlı biçimde ele alır ve uzun belgelerden kısa taleplere kadar geniş bir görev yelpazesini kapsar. Değerlendirme sürecinde, yalnızca yanıtların doğruluğu değil, kullanıcının örtük ihtiyaçları ve bağlamı da dikkate alınır. Gerçek yaşam senaryolarında, kullanıcı talepleri her zaman açıkça ifade edilmeyebilir; bu yüzden TRUEBench, bu belirsizlikleri da yakalamak üzere çok yönlü kriterler kullanır ve ayrıntılı bir doğrulama sağlar. Değerlendirme öğelerinin güvenilirliğini artırmak için Samsung Research, gerçek yorumcularla karşılıklı doğrulama mekanizmasını uygular: yorumcular kriterleri belirler, yapay zeka ise hataları ve çelişkileri tespit eder; süreç daha hassas standartlar oluşturacak biçimde tekrarlanır. Böylece önyargılar minimize edilir ve tutarlılık sağlanır. Her testte tüm koşulların karşılanması gerekir; bu da daha ayrıntılı ve adil bir puanlama sağlar. TRUEBench’in verileri ve puanlama tabloları, küresel açık kaynak platformu Hugging Face üzerinde paylaşılır ve bu sayede kullanıcılar beş modele kadar karşılaştırma yapabilirler. Ayrıca ortalama yanıt süreleri ile ilgili veriler de erişilebilir durumda olup performans ile verimliliğin birlikte değerlendirilebilmesini sağlar. Kaynak: Beyaz Haber Ajansı (BYZHA)
Bilim ve Teknoloji
Yayınlanma: 05 Ekim 2025 - 11:24
TRUEBench: Gerçek Dünya Verimliliğini Ölçen Samsung'ın Yapay Zeka Değerlendirme Çözümü
TRUEBench: Samsung’ın yapay zeka çözümlerinin gerçek dünya verimliliğini ölçen güvenilir değerlendirme platformu.
Bilim ve Teknoloji
05 Ekim 2025 - 11:24









