APIMart
dots-note-3.0がIMOで満点を達成

dots-note-3.0がIMOで満点を達成

Xiaohongshuのdots-note-3.0が2026年のIMOで42/42を獲得したと報告されています。自己検証とPythonによる確認を用いた証明作成ワークフローを解説します。

モデル解説

あるAIモデルが、公式の人間による採点のもと、2026年のIMOで満点の_42/42_を獲得しました。 つまり、Xiaohongshuの**dots-note-3.0**は最終回答を正しく出しただけでなく、採点者が認めた6つの完全な証明を書き上げたのです。

要点をまとめると次のとおりです。

  • 時期: 2026年7月
  • 大会: 上海で開催された国際数学オリンピック
  • 得点: 42点中42点
  • 人間との比較: 満点を獲得した学生も666人中7人のみ
  • 変化: これまでのAI最高成績は2025年の35/42
  • 注目される理由: IMOでは答えを推測するのではなく、長い証明を一歩ずつ書く能力が試される

簡単に言えば、この結果は、極めて難しい1つのテストにおいてAIによる証明作成が新たな段階へ進んだことを示しています。ただし、日常的な利用でもAIが完璧だという意味ではありません。 IMOの問題は明確で構造化されていますが、通常の課題はそうとは限りません。

特に際立っているのはモデルのワークフローです。生のLaTeXを読み、代数、幾何学、組合せ論、数論にまたがる証明を組み立て、提出前にテキスト推論とPythonによる検証を組み合わせた自己検証ループを実行しました。この点は、あるモデルの出力を別のモデルへ渡すシステムでも、同様のステップ管理が役立つ可能性を示しています。

したがって、平易にまとめればこうなります。dots-note-3.0は数学コンテストで稀有な得点を達成し、その本質は数学力だけでなく証明の品質にあります。

dots-note-3.0 IMO 2026:AIが達成した満点の主要データ
dots-note-3.0 IMO 2026:AIが達成した満点の主要データ

AIモデルが国際数学オリンピックで史上初の100%満点を獲得

国際数学オリンピック

IMOベンチマークとdots-note-3.0の公式結果

dots-note-3.0

IMOは、20歳未満の学生を対象に2日間で6問の証明問題に取り組む大会です。各問題は7点で、満点は42点です。正しい最終数値を出せば満点になる種類の数学コンテストではありません。高得点を得るには、論理的に妥当な完全な証明を示す必要があります。部分点は証明の完成度によって決まります。[5][3]

2026年7月、IMOは上海で開催され、117か国から666人が参加しました。人間の競技が終了した後、Xiaohongshuは公式の採点規則に従い、人間の介入なしでdots-note-3.0を実行し、その解答を公式採点に提出しました。モデルは6問すべてで7点中7点を獲得し、42点中42点の満点となりました。[1][2][4]

この詳細は重要です。IMOでの満点は、運やパターンマッチングで答えを当てたという意味ではありません。提出された内容が、最初から最後まで完全な証明ベースの推論として認められたということです。

42点中42点の満点はどのように採点されるか

満点の42/42を得るには、すべての証明が完全でなければなりません。ステップの欠落、論理の飛躍、条件の見落としは許されません。IMOの採点者は結論だけでなく、推論そのものの質を評価します。[5][3]

簡単に言えば、基準は非常に高いものです。解答者は6問すべてで整然とした論理の連鎖を保ち、公式審査に耐える形で示さなければなりません。

この結果が歴史的に重要な理由

公式IMOの審査で満点を獲得した大規模言語モデルは、これが初めてです。[1][4]

dots-note-3.0が実証しなければならなかった能力

42/42を獲得するために、dots-note-3.0は正しい答えに到達する以上のことを行う必要がありました。生のLaTeXで書かれた問題文を読み、証明方針を選び、コンテストの制限時間内に人間の採点者が確認できる完全な証明を書かなければなりませんでした。 [1] したがって、入力形式と証明の品質は、最終結果と同じくらい重要でした。

LaTeXの問題を読み、完全な証明を書く

dots-note-3.0は、生のLaTeXで書かれた問題文を直接読み、公式採点者が評価する完全で人間に読みやすい証明を生成しました。 [1] 生の問題文から検証可能な証明へ進むこの飛躍に、より深い推論能力が表れています。

代数、幾何学、組合せ論、数論にまたがる多段階推論

IMOの全6問を解くには、代数、幾何学、組合せ論、数論にまたがる幅広い推論能力を示す必要があります。 [1][2] 平たく言えば、幾何学的な論証を構築し、整数の性質を証明し、組合せ論的な場合分けを行い、中間補題を1つの妥当な推論の流れへ結び付けるということです。

2026年の問題には物語形式で出題されたものもあり、モデルは物語部分を取り除き、その背後にある数学を抽出する必要もありました。 [1]

このレベルの推論で扱えるタスク例

実際には、このレベルの推論は次のような形で表れます。

分野タスク例
幾何学与えられた配置から幾何学的な論証を構築
数論整数の性質を証明
組合せ論場合分けを通じて、有効な配置を数えたり除外したりする
代数恒等式と補題をつなぎ、唯一の妥当な結論へ到達

モデルは、公式のIMO審査基準を満たす形式で、結論がなぜ真でなければならないかも示す必要がありました。 [1][2] こうした証明能力は、この結果がより広いAI推論研究にとって重要な大きな理由でもあります。

この結果がAI推論研究にとって重要な理由

IMOがAIにとって極めて難しいのは、多肢選択式テストではないからです。参加者は完全な証明を一歩ずつ書く必要があり、場合分けや条件を1つ見落とすだけでも失点します。したがって、このベンチマークは最終回答の見た目だけでなく、証明全体の妥当性を測ります。

これは大きな意味を持ちます。回答のみを評価するベンチマークでは、モデルが誤った理由から正しい結果へ到達しても、弱い推論が隠れてしまうことがあります。IMOでは見過ごされません。最初から最後まで論理を維持できるかが確認されます。

高度な推論精度について、この結果が示すこと

満点の42/42は、モデルが証明の道筋を描き、中間ステップを自ら検証し、論理の連鎖を壊さず各論証を完結できたことを示唆します。平たく言えば、長い証明全体で自己検証能力が強化されたことを示しています。

前年との比較でも飛躍は際立ちます。2025年の最高システムは35/42だったため、42/42は証明の完成度が明確に向上したことを表します [3]

より難しい問いは、その推論能力がコンテスト数学の外でどの程度通用するかです。

ベンチマークの限界が依然として重要な理由

IMOで満点を得ても、複雑な日常環境での幅広い信頼性が証明されたわけではありません。コンテスト問題は構造化されていますが、現実の入力はそうとは限りません。ノイズが多く、曖昧で、重要な情報が欠けている場合もあります [6]

したがって、この結果は高度な数学推論を示す強力な証拠ですが、汎用的な理解を保証するものと解釈すべきではありません。

この一貫性こそが、マルチモーダルでAPI駆動のワークフローにおいて高度な推論を有用にします。

IMOレベルの推論をマルチモーダルおよびAPI駆動アプリケーションへ応用する方法

実際のワークフローで強力な推論が役立つ場面

このレベルの一貫性が最も重要になるのは、推論が大きなパイプラインの一部にすぎない場合です。本番環境では、制約を1つ見落とすだけで結果全体が狂うことがあります。研究アシスタント、指導ツール、コーディングエージェントのいずれも、最初から最後まですべての制約を維持するという同じ課題を抱えています。

そこで自己検証ループが役立ちます。小さなミスが大きな失敗へ膨らむ前に、早期に発見できます。

APIMartで推論モデルと動画・画像・言語モデルを組み合わせる

GccAi

マルチモーダルなパイプラインでは、推論モデルが動画や画像生成モデルへ渡す前に入力を検証できます。メディア生成を開始する前のゲートとして推論を使う場合にも、同じ考え方が機能します。

APIMartを使えば、チームは1つのAPIを通じて推論、画像、動画、言語モデルを組み合わせられます。まず入力を検証し、その後動画モデルへ送信できます。

日常的な利用では、推論精度がマルチモーダルパイプラインの信頼性を支える層になります。IMOレベルの推論が数学の枠を超えて重要なのはそのためです。マルチモーダルシステムをより確信を持って検証し、振り分け、利用できるようになります。

結論:検証された推論の節目と実践的な示唆

dots-note-3.0は、2026年の国際数学オリンピック(IMO)で42点中42点の満点を獲得しました。人間の審査員が各証明のすべての行を読み採点する公式採点のもとで、AIモデルがこの得点に到達したのは初めてです [1][7]

モデルは人間の支援を受けず、IMOの全問題について完全な証明を書きました。最終提出の前に、テキスト推論とPythonによる検証を用いた反復ループで、自らの証明をテストし、修正し、精緻化しました [7]。最も際立っているのは、モデルが自分の作業を確認し、途中で誤りを修正できた点です。

マルチモーダルなワークフローを構築するAPIMartユーザーにとって、それが最大の教訓です。IMOレベルの証明作成能力が、あらゆるユースケースで完璧な信頼性を意味するわけではありません。しかし、重要な進歩を示しています。検証可能な推論が、本番ワークフローでチームが頼れるものに近づいています。

簡単に言えば、自己検証型の推論は、言語・画像・動画モデルを組み合わせるAPIMartワークフローへの信頼を高められます。

よくある質問

IMOでの満点がAIにとって大きな出来事なのはなぜですか?

国際数学オリンピック(IMO)での満点が重要なのは、パターンマッチングを超えた能力を示すからです。IMOは答えだけでなく、_完全な数学的証明_を要求します。

したがって、モデルが42点中42点を獲得するのは小さな成果ではありません。論理エラー、条件の欠落、根拠のない主張を含まず、長い論証を一歩ずつ構築して最初から最後まで維持できることを意味します。

この精度は、推論を一度の飛躍ではなく、多くのステップにわたって行う必要がある場合に重要です。

dots-note-3.0は数学コンテスト以外でも信頼できるという意味ですか?

国際数学オリンピックでの満点は、強力で誤りのない論理推論を示しています。しかし、現実のあらゆる状況で信頼できることを保証するものではありません。

IMOが厳格な条件下で測るのは、限定された種類の数学推論です。dots-note-3.0を本格導入する前に、実際の本番ワークロード、評価基準、トラフィックパターンで検証する必要があります。

IMOレベルの推論は実際のAIワークフローにどう役立ちますか?

IMOレベルの推論が実際のAIワークフローで役立つのは、最後に答えだけを出すのではなく、難しい問題を一歩ずつ処理するようモデルに求めるからです。多段階の数学では、序盤の小さなミスが後続すべてを狂わせるため、特に重要です。

途中の作業も確認しやすくなります。結果をブラックボックスとして扱うのではなく、各ステップを調べ、弱い箇所を見つけ、証明や論理のミスが広がる前に発見できます。

日常的な利用では、ツールを使うシステムの失敗を減らし、厳しい制約のもとで動作する際の精度を高め、一貫した論理を必要とする高度なマルチモーダルまたはAPI駆動アプリをより強力に支援できます。

次は試してみましょう

モデルマーケットで使いたいモデルを選ぶ

APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。

チャットモデル画像モデル動画モデル
モデルマーケットを見る