
Einblick in dots-note-3.0: Durchbruch bei KI-Mathematik
Erfahren Sie, wie dots-note-3.0 Berichten zufolge mit natürlichsprachlichen Beweisen, Python-Prüfungen und einem iterativen Selbstkontroll-Workflow die perfekte IMO-Punktzahl von 42/42 erzielte.
Ein KI-Modell erzielte Berichten zufolge 42/42 Punkte bei der IMO 2026, doch die eigentliche Geschichte ist nicht allein die Punktzahl. Ich würde es so zusammenfassen: dots-note-3.0 wurde dafür entwickelt, mathematische Beweise vor der Antwort zu entwerfen, zu prüfen und zu überarbeiten. Damit widmet es sich einer schwierigen Herausforderung für KI: jeden einzelnen Beweisschritt vom Anfang bis zum Ende logisch einwandfrei zu halten.
Hier ist die Kurzfassung:
- dots-note-3.0 ist ein auf Mathematik spezialisiertes Modell von RedNote/Xiaohongshu.
- Es erreichte Berichten zufolge die perfekte Punktzahl von 42/42 bei der Internationalen Mathematik-Olympiade 2026 in Shanghai.
- 2025 lagen die höchsten gemeldeten IMO-Ergebnisse von KI bei 35/42; das wäre also ein Sprung um 7 Punkte.
- Das Modell kombiniert natürlichsprachliches Denken mit Python-Prüfungen.
- Seine zentrale Methode ist eine Selbstkontrollschleife: einen Beweis schreiben, Schritte prüfen, Fehler korrigieren und erst dann antworten.
- Die Angabe stammt weiterhin vom Unternehmen selbst, daher bleibt eine externe Überprüfung wichtig.
- Der Artikel beleuchtet außerdem, was dies für Forschende, Lehrkräfte, Lernende, Entwickler und API-Nutzer bedeutet.
Der wichtigste Punkt ist einfach: Bei IMO-Aufgaben werden vollständige Beweise bewertet, nicht nur Endergebnisse. Ein einziger schwacher Schritt kann daher alles kosten. Sollte sich dots-note-3.0 bei unabhängigen Tests bewähren, wäre das ein Wandel von „KI, die häufig die richtige Antwort findet“ hin zu KI, die ihre Antwort Schritt für Schritt begründen kann.
Der Artikel hat für mich noch ein zweites Thema: Dieses Modell bewegt sich zwischen Beweisen in Alltagssprache und formalisierten Theorembeweisen. Dadurch sind seine Ausführungen leichter für Menschen zu lesen, auch wenn es nicht dieselben maschinenprüfbaren Garantien wie ein formales Beweissystem bietet.
Das IMO-Team von OpenAI erklärt, warum Modelle jetzt Mathematik auf Spitzenniveau lösen

Kurzer Vergleich
| Thema | dots-note-3.0 |
|---|---|
| Hauptfokus | Beweisbasiertes mathematisches Denken |
| Gemeldete Punktzahl bei der IMO 2026 | 42/42 |
| Angeführte bisherige Bestpunktzahl von 2025 | 35/42 |
| Zentrale Methode | Selbstkritik und Überarbeitungsschleife |
| Verwendete Werkzeuge | Natürliche Sprache und Python |
| Größte Stärke | Lücken vor der endgültigen Ausgabe erkennen |
| Wichtigste Einschränkung | Externe Bestätigung steht noch aus |
| Besonders geeignete Nutzer | Forschende, Lehrkräfte, Lernende, Entwickler |
In diesem Beitrag würde ich die Punktzahl also als Schlagzeile betrachten und den Workflow zur Beweisprüfung als den wirklich entscheidenden Aspekt.
Was dots-note-3.0 ist und warum sein gemeldetes IMO-Ergebnis wichtig ist
dots-note-3.0 ist das kleinste Modell in Xiaohongshus dots3-Familie. Es wurde für mathematisches Denken entwickelt und benötigt weniger Rechenleistung als die größeren Modelle jazz und aria. Das Modell befindet sich noch in der Betaphase. Das Unternehmen kündigte an, den Quellcode später zu veröffentlichen, nannte jedoch keinen Termin. Diese Ausgangslage ist hier wichtig, weil das Modell anhand beweisintensiven Denkens bewertet wird und nicht nur danach, ob die endgültige Ausgabe überzeugend aussieht. [2][4]
Die gemeldete Punktzahl von 42/42 bei der IMO 2026
Xiaohongshu zufolge erzielte dots-note-3.0 bei der Internationalen Mathematik-Olympiade 2026 in Shanghai die perfekte Punktzahl von 42 von 42 Punkten. Nach Angaben des Unternehmens löste das Modell alle sechs Aufgaben anhand der offiziellen Aufgabenstellungen und verfasste vollständige natürlichsprachliche Beweise ohne logische Lücken oder fehlende Bedingungen. Während des Tests gab es keine menschliche Unterstützung, und die Lösungen wurden den IMO-Verantwortlichen zur Bewertung vorgelegt. [2][4][3]
Diese Punktzahl liegt über den 35/42, die 2025 für führende Modelle gemeldet wurden. [2][4] Die Schlagzeile fällt also zweifellos auf. Dennoch ist eine unabhängige Bestätigung erforderlich.
Warum diese Angabe über typische Benchmark-Erfolge hinausgeht
Die IMO funktioniert nicht wie ein Multiple-Choice-Test oder ein Benchmark mit kurzen Antworten. Sie bewertet vollständige Beweise. Bei diesem Ergebnis geht es somit um durchgängiges Denken vom Anfang bis zum Ende, nicht nur darum, die richtige Antwort auszuwählen oder zur richtigen Schlusszeile zu gelangen.
Welche Grenzen der Verifizierung Leser beachten sollten
Derzeit beruht das Ergebnis von 42/42 auf Angaben von Xiaohongshu selbst. Das Unternehmen erklärt, seine KI-generierten Lösungen seien offiziellen IMO-Verantwortlichen zur Bewertung vorgelegt worden. Dennoch sind eine unabhängige Prüfung und weitere Einzelheiten zum Bewertungsverfahren notwendig, bevor sich die Behauptung vollständig überprüfen lässt. [3][2]
Vorerst sollte das Ergebnis von 42/42 als vielversprechend, aber noch nicht bestätigt gelten. Sobald der Quellcode veröffentlicht ist und unabhängige Forschende das Modell mit neuen Aufgaben testen können, dürfte sich zeigen, ob diese Leistung Bestand hat.
Wie dots-note-3.0 das mathematische Denken verbessert

Rekursive Selbstkritik und Überarbeitung vor der endgültigen Antwort
dots-note-3.0 verbindet natürlichsprachliches Denken mit Python-Prüfungen, um Zwischenschritte zu verifizieren [1]. Statt beim ersten Entwurf zu bleiben, durchläuft es wiederholt einen Prüfzyklus: Es testet jeden Schritt, erkennt Fehler und schreibt den Beweis um, bevor es eine endgültige Antwort ausgibt [1]. Das ist der Hauptgrund für das gemeldete IMO-Ergebnis.
Da bei der IMO vollständige Beweise bewertet werden, soll dots-note-3.0 die Logik der gesamten Argumentation absichern und nicht bloß die richtige Endantwort treffen [1][2]. Das ist besonders bei theoremartigen Aufgaben entscheidend, bei denen ein einziger fehlerhafter Schritt alles Nachfolgende entwerten kann [1][2].
Mathematische Gebiete, in denen rekursive Selbstprüfung am meisten hilft
Die größten Vorteile zeigen sich in Bereichen, in denen jeder Schritt für sich Bestand haben muss.
| Mathematisches Gebiet | Ansatz von dots-note-3.0 | Konkretes Beispiel |
|---|---|---|
| Olympiade-Beweise | Iterative Selbstprüfung von Annahmen | Einen fehlenden Randfall in einer Kombinatorikaufgabe vor der Fertigstellung erkennen |
| Symbolische Algebra | Ausführung von Python-Code zur Prüfung von Schritten | Einen Vorzeichenfehler beim Ausmultiplizieren eines komplexen Polynoms erkennen |
| Geometrische Beweise | Strenge Prüfung geometrischer Bedingungen | Einen Beweis überarbeiten, nachdem erkannt wurde, dass eine bestimmte Dreieckseigenschaft angenommen, aber nicht bewiesen wurde |
| Analysis | Prüfung mehrstufiger Herleitungen | Einen fehlerhaften Schritt bei der partiellen Integration korrigieren, indem die Zwischenableitung erneut ausgewertet wird |
Vergleichstabelle der Denkmethoden
Diese Tabelle zeigt, wie sich der Ansatz von gängigen Denk-Workflows unterscheidet.
| Denkmethode | Stärken | Einschränkungen | Besonders geeignete mathematische Aufgaben |
|---|---|---|---|
| Rekursive Selbstkritik (dots-note-3.0) | Hohe Genauigkeit; erkennt logische Lücken; behebt Zwischenfehler durch iterative Selbstprüfung | Höherer Rechenaufwand und längere Latenz durch wiederholte Entwürfe | Beweise im Olympiade-Stil, komplexe mehrstufige Theoreme, geometrische Beweise |
| Standardmäßige Chain-of-Thought (CoT) | Verbessert die Leistung bei einfachen Textaufgaben; leicht umzusetzen | Neigt zu halluzinierten logischen Schritten; kann sich nicht erholen, wenn ein früher Schritt falsch ist | Grundrechenarten, einfache algebraische Textaufgaben |
| Werkzeuggestütztes Denken | Hohe Rechengenauigkeit dank Python; bewältigt komplexe symbolische Manipulationen | Die Werkzeugausgabe ist nur so gut wie die Logik ihres Aufrufs; keine tiefgreifende logische Selbstprüfung | Symbolische Algebra, Herleitungen in der Analysis, umfangreiche Berechnungen |
| Formale Beweis-Workflows | Bietet durch formale Verifizierung absolute mathematische Gewissheit | Erfordert die Übersetzung in formale Sprachen; sehr hohe Einstiegshürde | Theorembeweise, Formalisierung von Lehrbuchaufgaben |
Der Kompromiss ist einfach: mehr Rechenleistung und längere Wartezeit im Austausch gegen einen stärkeren Schutz vor Fehlern, die einen Beweis zunichtemachen.
Wo dots-note-3.0 in der aktuellen KI-Mathematikforschung einzuordnen ist
Natürlichsprachliche Beweise gegenüber formalen Theorembeweisen
Diese Methode ist wichtig, weil sie sich im Mittelfeld zwischen menschenlesbaren Beweisen und maschinengeprüfter formaler Verifizierung bewegt.
In der aktuellen KI-Mathematikforschung ist diese Unterscheidung hilfreich. Auf der einen Seite stehen Systeme für natürlichsprachliche Beweise. Sie verbinden schriftliche Erklärungen mit Werkzeugen wie Python. Auf der anderen Seite stehen formale Theorembeweiser, bei denen jeder Schritt in einer Sprache wie Lean geschrieben und anschließend von einer Maschine geprüft wird.
dots-note-3.0 gehört zur ersten Gruppe. Es nutzt natürlichsprachliches Denken und Python-Prüfungen. Interessant ist nicht nur, dass es die richtige Antwort findet. Vielmehr verwandelt es mathematisches Denken in einen lesbaren, selbstkorrigierenden Beweisprozess, statt wie eine Blackbox lediglich ein Endergebnis auszugeben.
Dieser Unterschied ist wichtig. Natürlichsprachliche Beweise sind für Menschen leichter nachzuvollziehen. Formale Beweise sind stärker, wenn maschinelle Verifizierung das Ziel ist. Der Kompromiss ist klar: Natürlichsprachliche Beweise können weiterhin kleine logische Lücken verbergen, die ein formales System sofort erkennen würde.
Benchmarks, die über ein einzelnes Schlagzeilenergebnis hinaus zählen
Dieselbe Unterscheidung zeigt sich bei der Wahl der Benchmarks.
Das IMO-Ergebnis ist stark, aber es handelt sich nur um einen Benchmark. Forschende beobachten außerdem GSM8K, MATH500, AIME, MathVista und GPQA, weil jeder davon einen anderen Aspekt des Denkens prüft – etwa Tiefe, Geometrie, visuelle Mathematik oder Problemlösung auf Expertenniveau.
Die IMO zeichnet sich dadurch aus, dass vollständige schriftliche Beweise bewertet werden. Ein ausgelassener Fall oder eine nicht genannte Bedingung kann echte Punkte kosten. Das unterscheidet sie deutlich von Tests, die nur das Endergebnis prüfen. Für ein Modell, das auf Arithmetik, Algebra, Geometrie, Analysis und beweisbasiertes Arbeiten ausgerichtet ist, ist die IMO daher ein wesentlich anspruchsvolleres Ziel.
Vergleichstabelle für Modelle und Benchmarks
Die folgende Tabelle stellt dots-note-3.0 anderen Systemen gegenüber und verdeutlicht damit seine Position in der aktuellen KI-Mathematikforschung.
| System | Primärer Aufgabentyp | Wichtigster Benchmark | Ausgabestil | Gemeldete Stärke |
|---|---|---|---|---|
| dots-note-3.0 | Denken auf Olympiade-Niveau | IMO 2026 (42/42) [1][2][4] | Natürliche Sprache und Python | Agentische Selbstkritikschleife; lückenlose Beweisführung |
| Huawei Celia | Denken auf Olympiade-Niveau | IMO 2026 (42/42) [3] | Mathematische Beweise | Mathematische Fähigkeiten in mehreren Fachgebieten |
| Moonshot AI Kimi K3 | Anspruchsvolles Denken | IMO 2026 (42/42) [3] | Natürliche Sprache | Erreichte die Schwelle zur perfekten Punktzahl |
| DeepMind/OpenAI (2025) | Denken auf Olympiade-Niveau | IMO 2025 (35/42) [1][2][4] | Formal und natürliche Sprache | Leistung auf Goldmedaillen-Niveau |
Das wichtigste Unterscheidungsmerkmal ist nicht allein die Punktzahl. Es ist die Selbstkritikschleife, die Beweise vor der Abgabe korrigiert. Dieser Aspekt bestimmt, wie sich das Modell in Forschung und Produkt-Workflows einfügt.
Was dies für Forschende, Lehrkräfte, Lernende, Entwickler und Nutzer von APIMart bedeutet

Praktische Einsatzmöglichkeiten in Bildung, Forschung und Softwareprodukten
dots-note-3.0 erzielt nicht nur bessere Benchmark-Ergebnisse. Seine größere Stärke liegt darin, das eigene Denken zu prüfen und zu überarbeiten, wodurch alltägliche Workflows zuverlässiger werden. Einfach ausgedrückt macht es schlüssiges Denken auf Beweisniveau für Forschung, Lehre und Software nutzbar.
Forschende können damit Vermutungen testen, Gegenbeispiele suchen und Beweisschritte vor der Formalisierung auf Belastbarkeit prüfen. Das ist wichtig, weil seine Selbstprüfungsschleife darauf ausgelegt ist, logische Lücken und übersehene Bedingungen zu reduzieren [2][4].
Lehrkräfte können das Modell verwenden, um ausgearbeitete Beispiele und Lösungsschlüssel zu erstellen. Es kann eine Herleitung nachvollziehen, den fehlerhaften Schritt erkennen und eine korrigierte Lösung liefern. Lernende profitieren von derselben Hilfe aus der anderen Perspektive: einem Tutor, der erklärt, warum eine Antwort falsch ist, und nicht nur, dass sie falsch ist [2].
Entwickler, die quantitative Produkte erstellen, benötigen Präzision und eine stabile Formatierung. Ein Finanz-SaaS-Workflow kann das Modell beispielsweise zur Berechnung von Zinseszinsen oder zur Ausgabe strukturierter Zahlenwerte verwenden und dabei die US-amerikanische Zahlenschreibweise wie 1,000.25 beibehalten [2].
Wie APIMart Workflows für mathematisches Denken im großen Maßstab unterstützen kann
Mit der einheitlichen API von APIMart können Teams Workflows für mathematisches Denken einfacher entwickeln, ohne mehrere getrennte Integrationen verwalten zu müssen.
Für Entwickler liegen die größten Vorteile in der einfacheren Integration und einer übersichtlicheren Nutzungsplanung. Statt mehrere Endpunkte und werkzeugspezifische Workflows zu pflegen, können Teams Anfragen über eine API senden und die Ausgabe anschließend in das für ihr Produkt erforderliche Format bringen.
Tabelle zu Auswirkungen auf Nutzergruppen und Fazit
Diese Workflows sind besonders wichtig, wenn Menschen Erklärungen und nicht nur Antworten benötigen. Die folgende Tabelle zeigt, wie dieser Denkstil zu unterschiedlichen Nutzergruppen passt.
| Nutzergruppe | Anwendungsfall | Benötigte Fähigkeit | APIMart-Ablauf |
|---|---|---|---|
| Forschende | Entwerfen von Theoremen und Testen von Vermutungen | Formale Logik und stringente Beweiserstellung | Denkmodell -> JSON-Ausgabe -> LaTeX |
| Lehrkräfte | Prüfung von Lösungen und Unterstützung bei der Bewertung | Schrittweise Fehlerdiagnose | Eingabe von Lernenden -> Denkmodell -> Feedback |
| Lernende | Interaktive Nachhilfe und ausgearbeitete Beispiele | Natürlichsprachliche mathematische Erklärungen | Chat API -> Modus für schrittweises Denken |
| Entwickler | Quantitative SaaS- und Finanz-Workflows | Hochpräzise numerische und logische Analyse | Einheitliche API -> Strukturiertes JSON (z. B. $1,250.00) |
RedNote hat angekündigt, den Quellcode in naher Zukunft zu veröffentlichen, konkrete Bedingungen wurden jedoch noch nicht bekannt gegeben [2][4]. Für APIMart-Nutzer liegt der Reiz in zuverlässigem schrittweisem Denken, das sich nahtlos in Produkt-Workflows einfügt.
FAQs
Wie wurde die Punktzahl von 42/42 verifiziert?
Die Punktzahl von 42/42 wurde überprüft, indem die vollständigen IMO-Lösungstexte von dots-note-3.0 den IMO-Verantwortlichen zur menschlichen Bewertung vorgelegt wurden, wobei der Test ohne menschliches Eingreifen stattfand.
Die Bewertung beruhte auf der Richtigkeit und Vollständigkeit jedes erforderlichen Beweisschritts, nicht nur auf den numerischen Endergebnissen.
Was können Python-Prüfungen in einem Beweis bestätigen?
Bei dots-note-3.0 helfen Python-Prüfungen dabei, die Stichhaltigkeit eines Beweises zu verifizieren, indem sie den Denkentwurf des Modells testen, hinterfragen und präzisieren.
Sie können ausgelassene Fälle oder nicht genannte Bedingungen erkennen, die einen schriftlichen Beweis schwächen könnten. So lässt sich jeder Schritt vor der Abgabe auf logische Schlüssigkeit prüfen.
Wer profitiert am meisten von dots-note-3.0?
dots-note-3.0 eignet sich besonders für Forschende, Lehrkräfte und Entwickler, die bei der Bearbeitung schwieriger Aufgaben stringente, überprüfbare Genauigkeit benötigen.
Es liefert zuverlässiges schrittweises Denken in Algebra, Geometrie, Analysis und formaler Logik. Damit eignet es sich hervorragend für theorembasiertes Arbeiten und quantitative Analysen, bei denen selbst kleine Logikfehler oder nicht genannte Bedingungen kostspielig werden können.
Wählen Sie Ihr gewünschtes Modell im Marktplatz
Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.