APIMart
dots-note-3.0 получает максимальный результат на IMO

dots-note-3.0 получает максимальный результат на IMO

По сообщениям, dots-note-3.0 от Xiaohongshu набрала 42/42 балла на IMO 2026 года. Узнайте, как в ее процессе подготовки доказательств используются самопроверка и проверка с помощью Python.

Обзор модели

Модель ИИ получила максимальные 42/42 балла на IMO 2026 года по итогам официального оценивания людьми. Это означает, что dots-note-3.0 от Xiaohongshu не просто дала правильные конечные ответы — она составила шесть полных доказательств, принятых проверяющими.

Краткая версия:

  • Дата: июль 2026 года
  • Событие: Международная математическая олимпиада в Шанхае
  • Результат: 42 балла из 42
  • Сравнение с людьми: максимальный результат также получили лишь 7 из 666 учащихся
  • Что изменилось: предыдущий лучший результат ИИ составлял 35/42 в 2025 году
  • Почему это важно: IMO проверяет умение составлять длинные пошаговые доказательства, а не угадывать ответы

Проще говоря, этот результат показывает, что в одном очень сложном испытании создание доказательств с помощью ИИ вышло на новый уровень. Это не значит, что ИИ безошибочен в повседневном использовании. Задачи IMO четко сформулированы и структурированы, тогда как обычные задачи часто лишены этих качеств.

Особенно выделяется рабочий процесс модели. Она читала исходный LaTeX, строила доказательства по алгебре, геометрии, комбинаторике и теории чисел и перед отправкой применяла цикл самопроверки, сочетая текстовые рассуждения с проверками в Python. Это важно, поскольку аналогичный контроль каждого шага может быть полезен в системах, где результат одной модели передается другой.

Итак, главный вывод прост: dots-note-3.0 достигла редкого результата в математическом соревновании, но еще важнее качество доказательств, а не только математические способности.

dots-note-3.0 на IMO 2026: ИИ получает максимальный результат — ключевые показатели
dots-note-3.0 на IMO 2026: ИИ получает максимальный результат — ключевые показатели

Впервые модель ИИ набрала максимальные 100% на Международной математической олимпиаде

Международная математическая олимпиада

Бенчмарк IMO и официальный результат dots-note-3.0

dots-note-3.0

IMO — двухдневное соревнование для учащихся младше 20 лет, состоящее из шести задач на доказательство. Каждая задача оценивается в 7 баллов, поэтому максимальный результат равен 42. И это не то математическое соревнование, где правильного конечного числа достаточно для максимальной оценки. Чтобы получить высокий балл, участники должны представить полные и логически строгие доказательства. Частичная оценка зависит от полноты доказательства.[5][3]

В июле 2026 года IMO прошла в Шанхае с участием 666 конкурсантов из 117 стран. После завершения соревнования среди людей Xiaohongshu запустила dots-note-3.0 по официальным правилам оценивания, без вмешательства человека, и передала ее решения на официальную проверку. Модель получила 7 баллов из 7 за каждую из шести задач, то есть максимальные 42 балла из 42.[1][2][4]

Эта деталь важна. Максимальный результат на IMO не означает, что участник угадал ответы или подобрал их по шаблонам. Он означает, что представленная работа выдержала проверку как полноценное доказательное рассуждение от начала до конца.

Как выставляется максимальный результат 42 из 42

Чтобы получить максимальные 42/42, каждое доказательство должно быть полным. Никаких пропущенных шагов, логических пробелов или нерассмотренных условий. Проверяющие IMO оценивают качество самих рассуждений, а не только конечный результат.[5][3]

Проще говоря, планка очень высока. Участник должен провести четкую цепочку логических рассуждений через все шесть задач так, чтобы она выдержала официальную проверку.

Почему этот результат имеет историческое значение

Это первая большая языковая модель, получившая максимальный результат при официальном судействе IMO.[1][4]

Какие способности требовалось продемонстрировать dots-note-3.0

Чтобы получить 42/42, dots-note-3.0 должна была не просто прийти к правильному ответу. Ей требовалось прочитать исходные условия в LaTeX, выбрать путь доказательства, а затем в отведенное время составить полное доказательство, которое смогли бы проверить люди. [1] Поэтому формат входных данных и качество доказательства были не менее важны, чем конечный результат.

Чтение задач в LaTeX и составление полных доказательств

dots-note-3.0 работала непосредственно с исходными условиями в LaTeX и создавала полные, понятные человеку доказательства, которые оценивали официальные проверяющие. [1] Именно в переходе от исходного условия к проверенному доказательству проявляется способность к более глубоким рассуждениям.

Многошаговые рассуждения в алгебре, геометрии, комбинаторике и теории чисел

Решение всех шести задач IMO требует широких способностей к рассуждению в алгебре, геометрии, комбинаторике и теории чисел. [1][2] На практике это означает построение геометрических рассуждений, доказательство свойств целых чисел, разбор комбинаторных случаев и объединение промежуточных лемм в единую корректную цепочку рассуждений.

Некоторые задачи 2026 года также были сформулированы в виде сюжетных историй, поэтому модели требовалось отбросить повествовательную оболочку и выделить лежащую в основе математическую задачу. [1]

Примеры задач, доступных для рассуждений такого уровня

Вот как рассуждения этого уровня выглядят на практике:

ОбластьПример задачи
ГеометрияПостроить геометрические рассуждения для заданной конфигурации
Теория чиселДоказать свойства целых чисел
КомбинаторикаРазобрать случаи, чтобы подсчитать или исключить допустимые варианты
АлгебраВыстроить цепочку тождеств и лемм, ведущую к единственно верному выводу

Модель также должна была показать, почему вывод обязательно верен, причем в форме, соответствующей официальным стандартам судейства IMO. [1][2] Эти же навыки доказательства во многом объясняют значение результата для более широких исследований рассуждений ИИ.

Почему этот результат важен для исследований рассуждений ИИ

IMO представляет особую сложность для ИИ, поскольку это не тест с вариантами ответа. Участникам нужно писать полные пошаговые доказательства, и даже один пропущенный случай или одно неуказанное условие могут стоить баллов. Поэтому этот бенчмарк проверяет корректность доказательства от начала до конца, а не только правдоподобность конечного ответа.

Это очень важно. Бенчмарки, проверяющие лишь ответы, могут скрывать слабые рассуждения, если модель приходит к верному результату по неверной причине. IMO такого не допускает: она проверяет способность модели сохранять логическую связность от начала до конца.

Что это говорит о точности сложных рассуждений

Максимальные 42/42 свидетельствуют о том, что модель смогла спланировать доказательство, проверить собственные промежуточные шаги и завершить каждое рассуждение, не разорвав логическую цепочку. Проще говоря, это указывает на более надежную самопроверку длинных доказательств.

Прогресс особенно заметен в контексте. В 2025 году лучшие системы достигли 35/42, поэтому 42/42 — явное повышение полноты доказательств [3].

Более сложный вопрос заключается в том, насколько такие рассуждения переносятся за пределы олимпиадной математики.

Почему ограничения бенчмарка по-прежнему важны

Даже максимальный результат на IMO не доказывает универсальную надежность в неоднозначных повседневных ситуациях. Конкурсные задачи структурированы, а реальные входные данные часто нет: они могут быть зашумленными, неясными или неполными [6].

Таким образом, результат убедительно свидетельствует о развитых математических рассуждениях. Но его не следует воспринимать как гарантию универсального понимания.

Именно такая стабильность делает развитые рассуждения полезными в мультимодальных процессах и системах на основе API.

Как рассуждения уровня IMO применимы в мультимодальных приложениях и приложениях на основе API

Где сильные рассуждения помогают в реальных процессах

Стабильность такого уровня особенно важна, когда рассуждение — лишь часть более крупного конвейера. В рабочей среде одно упущенное ограничение способно исказить весь результат. Исследовательский помощник, учебный инструмент и агент для программирования решают одну и ту же задачу: сохранить все ограничения от начала до конца.

Здесь помогает цикл самопроверки. Он способен выявлять мелкие ошибки заранее, прежде чем те нарастут и приведут к более серьезным сбоям.

Использование APIMart для объединения моделей рассуждений, видео, изображений и языка

GccAi

В мультимодальных конвейерах модель рассуждений может проверять входные данные до их передачи генератору видео или изображений. Тот же принцип работает, когда рассуждение должно служить контрольным этапом перед началом генерации медиаконтента.

APIMart позволяет командам объединять модели рассуждений, изображений, видео и языка через один API. Поэтому команды могут сначала проверить входные данные, а затем передать их видеомодели.

В повседневной работе точность рассуждений становится уровнем надежности мультимодальных конвейеров. Именно поэтому рассуждения уровня IMO важны за пределами математики: они помогают увереннее проверять, направлять и применять мультимодальные системы.

Вывод: проверенная веха в развитии рассуждений с практическими уроками

dots-note-3.0 набрала максимальные 42 балла из 42 на Международной математической олимпиаде (IMO) 2026 года. Это первый случай, когда модель ИИ достигла такой отметки при официальном оценивании людьми: проверяющие читали и оценивали каждую строку каждого доказательства [1][7].

Модель без помощи людей составила полные доказательства для всего комплекта задач IMO. Она использовала итеративный цикл с текстовыми рассуждениями и проверками в Python, чтобы тестировать, исправлять и уточнять собственные доказательства перед окончательной отправкой [7]. Особенно важно то, что модель могла проверять свою работу и исправлять ошибки по ходу решения.

Для пользователей APIMart, создающих мультимодальные процессы, в этом заключается главный урок. Умение составлять доказательства уровня IMO не означает абсолютную надежность во всех сценариях. Однако оно указывает на важную тенденцию: проверяемые рассуждения приближаются к уровню, на который команды смогут полагаться в рабочих процессах.

Проще говоря, рассуждения с самопроверкой могут повысить доверие к процессам APIMart, объединяющим модели языка, изображений и видео.

Часто задаваемые вопросы

Почему максимальный результат на IMO так важен для ИИ?

Максимальный результат на Международной математической олимпиаде (IMO) важен, потому что говорит о чем-то большем, чем сопоставление шаблонов. На IMO требуются не просто ответы, а полные математические доказательства.

Поэтому 42 балла из 42 — серьезное достижение для модели. Оно означает, что модель умеет строить длинные пошаговые рассуждения и сохранять их целостность от начала до конца, не допуская логических ошибок, пропущенных условий или необоснованных утверждений.

Такая точность важна, когда рассуждение состоит из множества шагов, а не одного скачка.

Означает ли это, что dots-note-3.0 надежна за пределами математических соревнований?

Максимальный результат на Международной математической олимпиаде указывает на сильные и безошибочные логические рассуждения. Но он не гарантирует надежность во всех реальных ситуациях.

IMO проверяет узкий вид математических рассуждений в строгих условиях. Перед полноценным развертыванием dots-note-3.0 все равно следует протестировать на ваших реальных рабочих нагрузках, критериях и профилях трафика.

Как рассуждения уровня IMO могут помочь реальным процессам ИИ?

Рассуждения уровня IMO полезны в реальных процессах ИИ, потому что побуждают модель решать сложные задачи шаг за шагом, а не просто выдавать конечный ответ. Это особенно важно для многошаговых математических задач, где одна небольшая ошибка в начале может исказить все последующие результаты.

Кроме того, так проще проверять промежуточную работу. Вместо восприятия результата как черного ящика можно изучить каждый шаг, найти слабые места и выявить ошибки в доказательстве или логике до того, как они распространятся дальше.

В повседневной работе это может означать меньше сбоев в системах, использующих инструменты, более высокую точность при строгих ограничениях и надежную основу для передовых мультимодальных приложений или приложений на основе API, которым необходима устойчивая логическая последовательность.

Готовы попробовать?

Выберите нужную модель в маркетплейсе моделей

Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.

Чат-моделиМодели изображенийВидео-модели
Открыть маркетплейс моделей