levanto ☀️ 🇰🇪 🇵🇸 retweetet

Can we reliably measure whether frontier models know they are being evaluated?
🔬 New paper from me, @xinningli6, @levanto_0,@AlexandraSouly, @_robertkirk: EvalDetectBench, a benchmark for measuring evaluation awareness in frontier LLMs 🧵

English



































