
Исследователи из Университета Дрекселя попытались заставить языковые модели изображать школьников с разным уровнем знаний по алгебре. Но одной инструкции
«отвечай как слабый ученик» для реальной роли двоечника оказалось недостаточно.Проблема в том, что модель уже знает правильное решение и с трудом подавляет собственные способности. Поэтому авторы разделили задачу на две: сначала отдельный алгоритм моделирует, что ученик знает и где ошибается, а затем LLM формулирует объяснение его ответа. Так удалось получить более правдоподобную градацию: точность «почти эксперта» составила 85,2%, среднего ученика — 57,8%, а слабого — 44,1%.
