@seeallochnaya TG
Большая часть ошибок — это потеря знака (плюс на минус и наоборот) в вычислениях людей и/или переносе решения в код для проверки, а также ошибка на +-1. Humans, what to say — большую часть ошибок помогла найти GPT-5.5
На первой картинке изменения в оценках для моделей GPT в tier 1-3 (полегче) и tier 4 (посложнее). На второй — абсолютный топ tier-4. Раньше каждая решённая задача в tier 4 сопровождалась комментариями от математика, принимавшего участие в её составлении; они писали, мол, я сам-то не сразу догадался, а модель вот нашла способ и придумала и вообще круто что такую сложную задачу берёт!
...а теперь оказалось, что зарешано 76% задач
UPD: Fable занял топ-1 на Tier-4 с 88%, всё, бенчмарк можно закрывать...
🔥 138 👍 31 🤡 20 🤣 13
8 🤯 7 👨💻 2 🤔 1