Arnold Bench

Модели Claude на задачах В. И. Арнольда

На математическом тривиуме Арнольда (100 задач, равные условия: минимальное усилие рассуждения, без инструментов) Opus решает 94% — и при этом тратит меньше всех за верный ответ: $0.035 против $0.039 у Sonnet и $0.045 у Haiku. Точнее — и дешевле.

Отрыв Opus и Sonnet от Haiku статистически надёжен (парный тест Мак-Немара, p < 0.002); разница Opus↔Sonnet на этой выборке — на грани значимости (p = 0.07). Детский набор задач насыщен: там все модели около 90% и не различаются. Задачи знамениты — часть верных ответов может быть памятью, а не выводом (см. методологию).

Кто решает лучше

Качество ↔ стоимость

Левее и выше — лучше. Каждая точка — одна конфигурация (модель × усилие).
Настроить график
Сплошная точка — полный набор задач (n≥90), полая — подвыборка ~10 задач. Кружок — без инструментов, ромб — с инструментами.

Итоги по моделям

Все конфигурации (модель × усилие × инструменты)
Дети vs тривиум: почему детский набор не различает
Детский уровень насыщен — все модели ~90%. Тривиум различает.
Разбивка по темам
Где модели расходятся по темам. Цвет ячейки — доля верных; рубрики отсортированы от самых трудных. «задач» — сколько задач рубрики в наборе.
Задачи-рисунки (vision-судья)
Модель РИСУЕТ ответ (matplotlib) → рендер → vision-судья оценивает рисунок покритериально. Нет рисунка = 0.
Методология
  • Прогон. Одна задача = один claude -p, stateless: без памяти, MCP, веба. Общий нейтральный промпт; режим задаёт только флаг tools off/on. Ответ — после FINAL ANSWER:.
  • Сетка. модель × усилие (low→max) × инструменты (off/on).
  • EM — детерминированная сверка с эталоном через sympy (дроби, степени, единицы, запятая 9,5, допуск ±%). Судья — opus-4-8 оценивает правильность и элегантность отдельно. Расхождения EM↔судьи видны в таблице.
  • Элегантность (0–10) — короткое/геометрическое решение выше брутфорса; оценивается отдельно от правильности.
  • Figure-задачи (рисунок-ответ). Где ответ — чертёж (#1,3,6,7,27,28,35,36,74), модель РИСУЕТ: выдаёт matplotlib-код → мы сэндбокс-рендерим в PNG → vision-судья оценивает рисунок ПОКРИТЕРИАЛЬНО по рубрике (нет рисунка = 0, не макс). #1 — graph-in: модель видит данный график. Эталон — оригинал из источника (Khesin/задачник), где есть.
  • Ограничения. Задачи знамениты → риск ответа по памяти (флаг при верном тривиуме <80 токенов). Детский набор без опубликованных ответов → там только судья. Судья оценивает и свои ответы (opus) → возможна само-предвзятость. Стоимость — по прайсу API.

Вопросы, эталонные ответы и ответы моделей

загрузка…
Откройте задачу — ссылка на неё появится в адресной строке, ей можно поделиться.
Данные: data.json · qa.json.
Оригинальные рисунки детского задачника — из проекта IMAGINARY/Arnold5to15 (В. И. Арнольд, «Задачи для детей от 5 до 15 лет»), лицензия CC BY-NC-SA 3.0, восстановлены векторно. Часть рисунков Тривиума (#6, #7, #36) — оригиналы из B. Khesin, S. Tabachnikov, «Comments on the Mathematical Trivium» (вытащены из PDF); остальные эталоны-ответы построены нами по решениям.