APIMart
Einblick in dots-note-3.0: Durchbruch bei KI-Mathematik

Einblick in dots-note-3.0: Durchbruch bei KI-Mathematik

Erfahren Sie, wie dots-note-3.0 Berichten zufolge mit natürlichsprachlichen Beweisen, Python-Prüfungen und einem iterativen Selbstkontroll-Workflow die perfekte IMO-Punktzahl von 42/42 erzielte.

Modell-Einblicke

Ein KI-Modell erzielte Berichten zufolge 42/42 Punkte bei der IMO 2026, doch die eigentliche Geschichte ist nicht allein die Punktzahl. Ich würde es so zusammenfassen: dots-note-3.0 wurde dafür entwickelt, mathematische Beweise vor der Antwort zu entwerfen, zu prüfen und zu überarbeiten. Damit widmet es sich einer schwierigen Herausforderung für KI: jeden einzelnen Beweisschritt vom Anfang bis zum Ende logisch einwandfrei zu halten.

Hier ist die Kurzfassung:

  • dots-note-3.0 ist ein auf Mathematik spezialisiertes Modell von RedNote/Xiaohongshu.
  • Es erreichte Berichten zufolge die perfekte Punktzahl von 42/42 bei der Internationalen Mathematik-Olympiade 2026 in Shanghai.
  • 2025 lagen die höchsten gemeldeten IMO-Ergebnisse von KI bei 35/42; das wäre also ein Sprung um 7 Punkte.
  • Das Modell kombiniert natürlichsprachliches Denken mit Python-Prüfungen.
  • Seine zentrale Methode ist eine Selbstkontrollschleife: einen Beweis schreiben, Schritte prüfen, Fehler korrigieren und erst dann antworten.
  • Die Angabe stammt weiterhin vom Unternehmen selbst, daher bleibt eine externe Überprüfung wichtig.
  • Der Artikel beleuchtet außerdem, was dies für Forschende, Lehrkräfte, Lernende, Entwickler und API-Nutzer bedeutet.

Der wichtigste Punkt ist einfach: Bei IMO-Aufgaben werden vollständige Beweise bewertet, nicht nur Endergebnisse. Ein einziger schwacher Schritt kann daher alles kosten. Sollte sich dots-note-3.0 bei unabhängigen Tests bewähren, wäre das ein Wandel von „KI, die häufig die richtige Antwort findet“ hin zu KI, die ihre Antwort Schritt für Schritt begründen kann.

Der Artikel hat für mich noch ein zweites Thema: Dieses Modell bewegt sich zwischen Beweisen in Alltagssprache und formalisierten Theorembeweisen. Dadurch sind seine Ausführungen leichter für Menschen zu lesen, auch wenn es nicht dieselben maschinenprüfbaren Garantien wie ein formales Beweissystem bietet.

Das IMO-Team von OpenAI erklärt, warum Modelle jetzt Mathematik auf Spitzenniveau lösen

OpenAI

Kurzer Vergleich

Themadots-note-3.0
HauptfokusBeweisbasiertes mathematisches Denken
Gemeldete Punktzahl bei der IMO 202642/42
Angeführte bisherige Bestpunktzahl von 202535/42
Zentrale MethodeSelbstkritik und Überarbeitungsschleife
Verwendete WerkzeugeNatürliche Sprache und Python
Größte StärkeLücken vor der endgültigen Ausgabe erkennen
Wichtigste EinschränkungExterne Bestätigung steht noch aus
Besonders geeignete NutzerForschende, Lehrkräfte, Lernende, Entwickler

In diesem Beitrag würde ich die Punktzahl also als Schlagzeile betrachten und den Workflow zur Beweisprüfung als den wirklich entscheidenden Aspekt.

Was dots-note-3.0 ist und warum sein gemeldetes IMO-Ergebnis wichtig ist

dots-note-3.0 ist das kleinste Modell in Xiaohongshus dots3-Familie. Es wurde für mathematisches Denken entwickelt und benötigt weniger Rechenleistung als die größeren Modelle jazz und aria. Das Modell befindet sich noch in der Betaphase. Das Unternehmen kündigte an, den Quellcode später zu veröffentlichen, nannte jedoch keinen Termin. Diese Ausgangslage ist hier wichtig, weil das Modell anhand beweisintensiven Denkens bewertet wird und nicht nur danach, ob die endgültige Ausgabe überzeugend aussieht. [2][4]

Die gemeldete Punktzahl von 42/42 bei der IMO 2026

Xiaohongshu zufolge erzielte dots-note-3.0 bei der Internationalen Mathematik-Olympiade 2026 in Shanghai die perfekte Punktzahl von 42 von 42 Punkten. Nach Angaben des Unternehmens löste das Modell alle sechs Aufgaben anhand der offiziellen Aufgabenstellungen und verfasste vollständige natürlichsprachliche Beweise ohne logische Lücken oder fehlende Bedingungen. Während des Tests gab es keine menschliche Unterstützung, und die Lösungen wurden den IMO-Verantwortlichen zur Bewertung vorgelegt. [2][4][3]

Diese Punktzahl liegt über den 35/42, die 2025 für führende Modelle gemeldet wurden. [2][4] Die Schlagzeile fällt also zweifellos auf. Dennoch ist eine unabhängige Bestätigung erforderlich.

Warum diese Angabe über typische Benchmark-Erfolge hinausgeht

Die IMO funktioniert nicht wie ein Multiple-Choice-Test oder ein Benchmark mit kurzen Antworten. Sie bewertet vollständige Beweise. Bei diesem Ergebnis geht es somit um durchgängiges Denken vom Anfang bis zum Ende, nicht nur darum, die richtige Antwort auszuwählen oder zur richtigen Schlusszeile zu gelangen.

Welche Grenzen der Verifizierung Leser beachten sollten

Derzeit beruht das Ergebnis von 42/42 auf Angaben von Xiaohongshu selbst. Das Unternehmen erklärt, seine KI-generierten Lösungen seien offiziellen IMO-Verantwortlichen zur Bewertung vorgelegt worden. Dennoch sind eine unabhängige Prüfung und weitere Einzelheiten zum Bewertungsverfahren notwendig, bevor sich die Behauptung vollständig überprüfen lässt. [3][2]

Vorerst sollte das Ergebnis von 42/42 als vielversprechend, aber noch nicht bestätigt gelten. Sobald der Quellcode veröffentlicht ist und unabhängige Forschende das Modell mit neuen Aufgaben testen können, dürfte sich zeigen, ob diese Leistung Bestand hat.

Wie dots-note-3.0 das mathematische Denken verbessert

Vergleich von Methoden für mathematisches Denken mit KI: dots-note-3.0 gegenüber anderen Ansätzen
Vergleich von Methoden für mathematisches Denken mit KI: dots-note-3.0 gegenüber anderen Ansätzen

Rekursive Selbstkritik und Überarbeitung vor der endgültigen Antwort

dots-note-3.0 verbindet natürlichsprachliches Denken mit Python-Prüfungen, um Zwischenschritte zu verifizieren [1]. Statt beim ersten Entwurf zu bleiben, durchläuft es wiederholt einen Prüfzyklus: Es testet jeden Schritt, erkennt Fehler und schreibt den Beweis um, bevor es eine endgültige Antwort ausgibt [1]. Das ist der Hauptgrund für das gemeldete IMO-Ergebnis.

Da bei der IMO vollständige Beweise bewertet werden, soll dots-note-3.0 die Logik der gesamten Argumentation absichern und nicht bloß die richtige Endantwort treffen [1][2]. Das ist besonders bei theoremartigen Aufgaben entscheidend, bei denen ein einziger fehlerhafter Schritt alles Nachfolgende entwerten kann [1][2].

Mathematische Gebiete, in denen rekursive Selbstprüfung am meisten hilft

Die größten Vorteile zeigen sich in Bereichen, in denen jeder Schritt für sich Bestand haben muss.

Mathematisches GebietAnsatz von dots-note-3.0Konkretes Beispiel
Olympiade-BeweiseIterative Selbstprüfung von AnnahmenEinen fehlenden Randfall in einer Kombinatorikaufgabe vor der Fertigstellung erkennen
Symbolische AlgebraAusführung von Python-Code zur Prüfung von SchrittenEinen Vorzeichenfehler beim Ausmultiplizieren eines komplexen Polynoms erkennen
Geometrische BeweiseStrenge Prüfung geometrischer BedingungenEinen Beweis überarbeiten, nachdem erkannt wurde, dass eine bestimmte Dreieckseigenschaft angenommen, aber nicht bewiesen wurde
AnalysisPrüfung mehrstufiger HerleitungenEinen fehlerhaften Schritt bei der partiellen Integration korrigieren, indem die Zwischenableitung erneut ausgewertet wird

Vergleichstabelle der Denkmethoden

Diese Tabelle zeigt, wie sich der Ansatz von gängigen Denk-Workflows unterscheidet.

DenkmethodeStärkenEinschränkungenBesonders geeignete mathematische Aufgaben
Rekursive Selbstkritik (dots-note-3.0)Hohe Genauigkeit; erkennt logische Lücken; behebt Zwischenfehler durch iterative SelbstprüfungHöherer Rechenaufwand und längere Latenz durch wiederholte EntwürfeBeweise im Olympiade-Stil, komplexe mehrstufige Theoreme, geometrische Beweise
Standardmäßige Chain-of-Thought (CoT)Verbessert die Leistung bei einfachen Textaufgaben; leicht umzusetzenNeigt zu halluzinierten logischen Schritten; kann sich nicht erholen, wenn ein früher Schritt falsch istGrundrechenarten, einfache algebraische Textaufgaben
Werkzeuggestütztes DenkenHohe Rechengenauigkeit dank Python; bewältigt komplexe symbolische ManipulationenDie Werkzeugausgabe ist nur so gut wie die Logik ihres Aufrufs; keine tiefgreifende logische SelbstprüfungSymbolische Algebra, Herleitungen in der Analysis, umfangreiche Berechnungen
Formale Beweis-WorkflowsBietet durch formale Verifizierung absolute mathematische GewissheitErfordert die Übersetzung in formale Sprachen; sehr hohe EinstiegshürdeTheorembeweise, Formalisierung von Lehrbuchaufgaben

Der Kompromiss ist einfach: mehr Rechenleistung und längere Wartezeit im Austausch gegen einen stärkeren Schutz vor Fehlern, die einen Beweis zunichtemachen.

Wo dots-note-3.0 in der aktuellen KI-Mathematikforschung einzuordnen ist

Natürlichsprachliche Beweise gegenüber formalen Theorembeweisen

Diese Methode ist wichtig, weil sie sich im Mittelfeld zwischen menschenlesbaren Beweisen und maschinengeprüfter formaler Verifizierung bewegt.

In der aktuellen KI-Mathematikforschung ist diese Unterscheidung hilfreich. Auf der einen Seite stehen Systeme für natürlichsprachliche Beweise. Sie verbinden schriftliche Erklärungen mit Werkzeugen wie Python. Auf der anderen Seite stehen formale Theorembeweiser, bei denen jeder Schritt in einer Sprache wie Lean geschrieben und anschließend von einer Maschine geprüft wird.

dots-note-3.0 gehört zur ersten Gruppe. Es nutzt natürlichsprachliches Denken und Python-Prüfungen. Interessant ist nicht nur, dass es die richtige Antwort findet. Vielmehr verwandelt es mathematisches Denken in einen lesbaren, selbstkorrigierenden Beweisprozess, statt wie eine Blackbox lediglich ein Endergebnis auszugeben.

Dieser Unterschied ist wichtig. Natürlichsprachliche Beweise sind für Menschen leichter nachzuvollziehen. Formale Beweise sind stärker, wenn maschinelle Verifizierung das Ziel ist. Der Kompromiss ist klar: Natürlichsprachliche Beweise können weiterhin kleine logische Lücken verbergen, die ein formales System sofort erkennen würde.

Benchmarks, die über ein einzelnes Schlagzeilenergebnis hinaus zählen

Dieselbe Unterscheidung zeigt sich bei der Wahl der Benchmarks.

Das IMO-Ergebnis ist stark, aber es handelt sich nur um einen Benchmark. Forschende beobachten außerdem GSM8K, MATH500, AIME, MathVista und GPQA, weil jeder davon einen anderen Aspekt des Denkens prüft – etwa Tiefe, Geometrie, visuelle Mathematik oder Problemlösung auf Expertenniveau.

Die IMO zeichnet sich dadurch aus, dass vollständige schriftliche Beweise bewertet werden. Ein ausgelassener Fall oder eine nicht genannte Bedingung kann echte Punkte kosten. Das unterscheidet sie deutlich von Tests, die nur das Endergebnis prüfen. Für ein Modell, das auf Arithmetik, Algebra, Geometrie, Analysis und beweisbasiertes Arbeiten ausgerichtet ist, ist die IMO daher ein wesentlich anspruchsvolleres Ziel.

Vergleichstabelle für Modelle und Benchmarks

Die folgende Tabelle stellt dots-note-3.0 anderen Systemen gegenüber und verdeutlicht damit seine Position in der aktuellen KI-Mathematikforschung.

SystemPrimärer AufgabentypWichtigster BenchmarkAusgabestilGemeldete Stärke
dots-note-3.0Denken auf Olympiade-NiveauIMO 2026 (42/42) [1][2][4]Natürliche Sprache und PythonAgentische Selbstkritikschleife; lückenlose Beweisführung
Huawei CeliaDenken auf Olympiade-NiveauIMO 2026 (42/42) [3]Mathematische BeweiseMathematische Fähigkeiten in mehreren Fachgebieten
Moonshot AI Kimi K3Anspruchsvolles DenkenIMO 2026 (42/42) [3]Natürliche SpracheErreichte die Schwelle zur perfekten Punktzahl
DeepMind/OpenAI (2025)Denken auf Olympiade-NiveauIMO 2025 (35/42) [1][2][4]Formal und natürliche SpracheLeistung auf Goldmedaillen-Niveau

Das wichtigste Unterscheidungsmerkmal ist nicht allein die Punktzahl. Es ist die Selbstkritikschleife, die Beweise vor der Abgabe korrigiert. Dieser Aspekt bestimmt, wie sich das Modell in Forschung und Produkt-Workflows einfügt.

Was dies für Forschende, Lehrkräfte, Lernende, Entwickler und Nutzer von APIMart bedeutet

APIMart

Praktische Einsatzmöglichkeiten in Bildung, Forschung und Softwareprodukten

dots-note-3.0 erzielt nicht nur bessere Benchmark-Ergebnisse. Seine größere Stärke liegt darin, das eigene Denken zu prüfen und zu überarbeiten, wodurch alltägliche Workflows zuverlässiger werden. Einfach ausgedrückt macht es schlüssiges Denken auf Beweisniveau für Forschung, Lehre und Software nutzbar.

Forschende können damit Vermutungen testen, Gegenbeispiele suchen und Beweisschritte vor der Formalisierung auf Belastbarkeit prüfen. Das ist wichtig, weil seine Selbstprüfungsschleife darauf ausgelegt ist, logische Lücken und übersehene Bedingungen zu reduzieren [2][4].

Lehrkräfte können das Modell verwenden, um ausgearbeitete Beispiele und Lösungsschlüssel zu erstellen. Es kann eine Herleitung nachvollziehen, den fehlerhaften Schritt erkennen und eine korrigierte Lösung liefern. Lernende profitieren von derselben Hilfe aus der anderen Perspektive: einem Tutor, der erklärt, warum eine Antwort falsch ist, und nicht nur, dass sie falsch ist [2].

Entwickler, die quantitative Produkte erstellen, benötigen Präzision und eine stabile Formatierung. Ein Finanz-SaaS-Workflow kann das Modell beispielsweise zur Berechnung von Zinseszinsen oder zur Ausgabe strukturierter Zahlenwerte verwenden und dabei die US-amerikanische Zahlenschreibweise wie 1,000.25 beibehalten [2].

Wie APIMart Workflows für mathematisches Denken im großen Maßstab unterstützen kann

Mit der einheitlichen API von APIMart können Teams Workflows für mathematisches Denken einfacher entwickeln, ohne mehrere getrennte Integrationen verwalten zu müssen.

Für Entwickler liegen die größten Vorteile in der einfacheren Integration und einer übersichtlicheren Nutzungsplanung. Statt mehrere Endpunkte und werkzeugspezifische Workflows zu pflegen, können Teams Anfragen über eine API senden und die Ausgabe anschließend in das für ihr Produkt erforderliche Format bringen.

Tabelle zu Auswirkungen auf Nutzergruppen und Fazit

Diese Workflows sind besonders wichtig, wenn Menschen Erklärungen und nicht nur Antworten benötigen. Die folgende Tabelle zeigt, wie dieser Denkstil zu unterschiedlichen Nutzergruppen passt.

NutzergruppeAnwendungsfallBenötigte FähigkeitAPIMart-Ablauf
ForschendeEntwerfen von Theoremen und Testen von VermutungenFormale Logik und stringente BeweiserstellungDenkmodell -> JSON-Ausgabe -> LaTeX
LehrkräftePrüfung von Lösungen und Unterstützung bei der BewertungSchrittweise FehlerdiagnoseEingabe von Lernenden -> Denkmodell -> Feedback
LernendeInteraktive Nachhilfe und ausgearbeitete BeispieleNatürlichsprachliche mathematische ErklärungenChat API -> Modus für schrittweises Denken
EntwicklerQuantitative SaaS- und Finanz-WorkflowsHochpräzise numerische und logische AnalyseEinheitliche API -> Strukturiertes JSON (z. B. $1,250.00)

RedNote hat angekündigt, den Quellcode in naher Zukunft zu veröffentlichen, konkrete Bedingungen wurden jedoch noch nicht bekannt gegeben [2][4]. Für APIMart-Nutzer liegt der Reiz in zuverlässigem schrittweisem Denken, das sich nahtlos in Produkt-Workflows einfügt.

FAQs

Wie wurde die Punktzahl von 42/42 verifiziert?

Die Punktzahl von 42/42 wurde überprüft, indem die vollständigen IMO-Lösungstexte von dots-note-3.0 den IMO-Verantwortlichen zur menschlichen Bewertung vorgelegt wurden, wobei der Test ohne menschliches Eingreifen stattfand.

Die Bewertung beruhte auf der Richtigkeit und Vollständigkeit jedes erforderlichen Beweisschritts, nicht nur auf den numerischen Endergebnissen.

Was können Python-Prüfungen in einem Beweis bestätigen?

Bei dots-note-3.0 helfen Python-Prüfungen dabei, die Stichhaltigkeit eines Beweises zu verifizieren, indem sie den Denkentwurf des Modells testen, hinterfragen und präzisieren.

Sie können ausgelassene Fälle oder nicht genannte Bedingungen erkennen, die einen schriftlichen Beweis schwächen könnten. So lässt sich jeder Schritt vor der Abgabe auf logische Schlüssigkeit prüfen.

Wer profitiert am meisten von dots-note-3.0?

dots-note-3.0 eignet sich besonders für Forschende, Lehrkräfte und Entwickler, die bei der Bearbeitung schwieriger Aufgaben stringente, überprüfbare Genauigkeit benötigen.

Es liefert zuverlässiges schrittweises Denken in Algebra, Geometrie, Analysis und formaler Logik. Damit eignet es sich hervorragend für theorembasiertes Arbeiten und quantitative Analysen, bei denen selbst kleine Logikfehler oder nicht genannte Bedingungen kostspielig werden können.

Bereit zum Ausprobieren?

Wählen Sie Ihr gewünschtes Modell im Marktplatz

Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.

Chat-ModelleBildmodelleVideomodelle
Modellmarktplatz öffnen