TRUEBench: Gerçek Dünya Verimliliğini Değerlendiren Samsung’un Yapay Zeka Benchmark Çözümü
Samsung Electronics, yapay zekâ verimliliğini ölçmek amacıyla Samsung Research tarafından geliştirilen ve adını TRUEBench olarak duyuran (Trustworthy Real-world Usage Evaluation Benchmark) çözümlerini tanıttı. TRUEBench, büyük dil modellerinin (LLM’ler) gerçek dünyadaki iş süreçlerinde nasıl performans gösterdiğini kapsamlı bir metrik setiyle ortaya koyuyor. Değerlendirme, gerçekçi diyalog senaryoları ve çok dilli çalışma koşulları üzerinden gerçekleştiriliyor.
Benchmark, içerik üretimi, veri analizi, özet çıkarma ve çeviri gibi kurumsal görevleri 10 ana kategori ve 46 alt kategori kapsamında inceleyerek güvenilir puanlar sunuyor. Yapay zekâ destekli otomatik değerlendirme yöntemi, kriterlerin insanlar ile yapay zeka ortaklığıyla tasarlanıp geliştirildiği bir süreçte hayata geçiriliyor. Bu sayede gerçek dünya iş akışlarındaki gereksinimler doğrultusunda net ve güvenilir sonuçlar elde ediliyor.
Paul (Kyungwhoon) Cheun ise Samsung Electronics Dijital Deneyimler CTO’su ve Samsung Research Başkanı olarak değerlendirme standartlarının üretkenlik alanında güçlü bir çerçeve oluşturacağına işaret ediyor. TRUEBench’in, üretkenlik işlerinde güvenilir ölçüm kriterleri sunması ve Samsung’un teknolojik liderliğini güçlendirmesi bekleniyor.
Günümüzde şirketler yapay zekâyı daha yoğun benimserken, büyük dil modellerinin üretkenliğini ölçmeye yönelik talep de artıyor. Çoğu mevcut kriter, İngilizce odaklılık nedeniyle yalnızca genel performansı değerlendirip tek tur sorularla sınırlı kalırken, gerçek iş ortamlarının karmaşıklığını yansıtmayabiliyor. Bu sınırlamaları aşmak için geliştirilmiş olan TRUEBench, 10 kategori ve 12 dilde çalışan 2.485 test seti ile dil ve senaryo çeşitliliğini sağlıyor; ayrıca çeviri ve uzun belgelerden özetlere uzanan çeşitli görevleri kapsıyor.
TRUEBench, yapay zekâ yanıtlarının doğruluğunu yalnızca yüzeysel olarak değil, kullanıcıların örtük isteklerini de yakalayacak ayrıntılı koşullarla değerlendiriyor. Böylece gerçek yaşam senaryolarında görülen belirsizlikler ve gereksinimler hesaba katılarak daha gerçekçi bir puanlama elde ediliyor. Değerlendirme sürecinde insanlar ile yapay zekâ iş birliğiyle oluşturulan kriterler sık sık güncelleniyor; gerçek yorumcuların kriterleri incelemesi, yapay zekânın hataları veya çelişkileri tespit etmesi ve ardından süreçlerin tekrar gözden geçirilmesiyle giderek daha hassas bir ölçüm elde ediliyor.
Bu çapraz doğrulama yaklaşımı, model otomatik değerlendirmesinde önyargıların azaltılmasına ve tutarlılığın artırılmasına katkıda bulunuyor. Her testte tüm koşulların karşılanması gerekliliği, görevlerin daha ayrıntılı ve adil puanlanmasını sağlıyor. Ayrıca TRUEBench’in veri setleri ve puanlama tabloları Hugging Face platformunda bulunuyor; bu, beş modele kadar karşılaştırma yapmayı mümkün kılarak kullanıcıların performansı tek bakışta incelemesini sağlıyor. Ayrıca ortalama yanıt süresi verileri de paylaşılarak performans ve verimlilik eşzamanlı olarak karşılaştırılabiliyor.