Meta merilis pratinjau WildArtifactBench, sebuah kerangka evaluasi internal yang dirancang khusus untuk menguji performa agen kecerdasan buatan (AI) pada tugas-tugas dunia nyata yang kompleks.
Sistem ini berfokus pada berbagai format hasil kerja (deliverable) yang beragam dalam alur kerja multimodal secara praktis. Sebagai langkah awal untuk mengukur kegunaan nyata dari agen AI tersebut, Meta turut membagikan 10 tugas dari kerangka kerja ini kepada publik.
Hal yang paling menarik dari WildArtifactBench adalah cara penilaiannya yang tidak lagi kaku menggunakan kunci jawaban tunggal (ground-truth rubrics).
Kerangka kerja ini justru memanfaatkan sistem win rate dan skor Elo—sistem pemeringkatan yang biasa digunakan dalam catur profesional maupun kompetisi game e-sports—berdasarkan penilaian hakim manusia dan agen AI.
Ibarat turnamen sabung bakat antarasisten digital, metode penilaian dinamis ini mampu menguji seberapa andal dan fleksibel sebuah agen AI dalam menyelesaikan pekerjaan kreatif hingga analisis data rumit layaknya pekerja manusia profesional.