
dots-note-3.0의 내부:AI 수학의 돌파구
dots-note-3.0이 자연어 증명, Python 검증, 반복적 자기 검토 워크플로를 통해 IMO에서 42/42 만점을 기록한 것으로 알려진 과정을 살펴봅니다.
한 AI 모델이 2026년 IMO에서 _42/42_를 기록한 것으로 알려졌지만, 핵심은 점수만이 아닙니다. 한마디로 요약하면, dots-note-3.0은 답을 내놓기 전에 수학 증명을 작성하고, 검증하고, 수정하도록 설계되었습니다. 이는 AI의 난제 중 하나인, 증명의 첫 단계부터 마지막 단계까지 모든 논리를 타당하게 유지하는 문제를 겨냥합니다.
짧게 요약하면 다음과 같습니다.
- dots-note-3.0은 RedNote/Xiaohongshu가 개발한 수학 특화 모델입니다.
- 상하이에서 열린 **2026년 국제수학올림피아드**에서 42/42 만점을 받은 것으로 알려졌습니다.
- 2025년에 보고된 최고 AI IMO 점수는 35/42였으므로, 이는 7점 상승한 결과입니다.
- 이 모델은 자연어 추론과 Python 검증을 함께 사용합니다.
- 핵심 방식은 자기 검토 루프입니다. 증명을 작성하고, 각 단계를 검증하고, 오류를 고친 뒤 답을 냅니다.
- 아직 회사가 발표한 결과이므로 외부 검증이 중요합니다.
- 이 글에서는 이 결과가 연구자, 교사, 학생, 개발자, API 사용자에게 무엇을 의미하는지도 살펴봅니다.
가장 중요한 점은 간단합니다. IMO 문제는 최종 답이 아니라 완전한 증명을 채점합니다. 따라서 단 하나의 취약한 단계만으로도 모든 점수를 잃을 수 있습니다. dots-note-3.0이 외부 시험에서도 같은 성과를 유지한다면, 이는 “정답을 자주 맞히는 AI”에서 _정답을 단계별로 논증할 수 있는 AI_로의 전환을 의미할 것입니다.
이 글에는 또 하나의 주제가 있습니다. 이 모델은 일상 언어로 쓰는 증명과 형식 정리 증명 사이에 자리합니다. 형식 증명 시스템과 같은 수준의 기계 검증 보장을 제공하지는 않지만, 사람이 훨씬 쉽게 읽을 수 있습니다.
모델이 마침내 최상위 수준의 수학을 풀게 된 이유를 설명하는 OpenAI IMO 팀

빠른 비교
| 항목 | dots-note-3.0 |
|---|---|
| 주요 초점 | 증명 기반 수학 추론 |
| 보고된 IMO 2026 점수 | 42/42 |
| 인용된 2025년 이전 최고 점수 | 35/42 |
| 핵심 방식 | 자기 비평 + 수정 루프 |
| 사용 도구 | 자연어 + Python |
| 주요 강점 | 최종 출력 전에 논리적 공백 발견 |
| 주요 한계 | 외부 검증이 아직 진행되지 않음 |
| 가장 적합한 사용자 | 연구자, 교육자, 학생, 개발자 |
따라서 이 글에서는 점수를 헤드라인으로 보되, 증명 검증 워크플로를 가장 중요한 부분으로 봐야 합니다.
dots-note-3.0이란 무엇이며, 보고된 IMO 결과가 중요한 이유
dots-note-3.0은 Xiaohongshu의 dots3 제품군에서 가장 작은 모델입니다. 더 큰 jazz 및 aria 모델보다 적은 연산량으로 수학적 추론을 수행하도록 개발되었습니다. 아직 베타 단계이며, 회사는 추후 소스 코드를 공개하겠다고 밝혔지만 날짜는 제시하지 않았습니다. 이 점은 중요합니다. 이 모델은 최종 출력이 그럴듯한지만이 아니라, 증명 중심의 추론 능력으로 평가받고 있기 때문입니다. [2][4]
보고된 IMO 2026의 42/42 점수
Xiaohongshu에 따르면 dots-note-3.0은 상하이에서 열린 2026년 국제수학올림피아드에서 42점 만점에 42점을 받았습니다. 회사 설명에 따르면, 모델은 공식 문제 원문을 바탕으로 6개 문제를 모두 풀었으며 논리적 공백이나 누락된 조건 없이 완전한 자연어 증명을 작성했습니다. 시험 중 사람의 도움은 전혀 없었고, 해답은 채점을 위해 IMO 주최 측에 제출되었습니다. [2][4][3]
이 점수는 2025년 선두 모델들이 기록한 것으로 알려진 35/42보다 높습니다. [2][4] 분명 눈길을 끄는 결과이지만, 여전히 외부 확인이 필요합니다.
이 주장이 일반적인 벤치마크 우승보다 더 나아간 이유
IMO는 객관식 시험이나 단답형 벤치마크와 다릅니다. 완전한 증명을 채점합니다. 즉, 정답을 고르거나 마지막 줄만 맞히는 것이 아니라 처음부터 끝까지 이어지는 추론을 평가하는 결과입니다.
독자가 염두에 두어야 할 검증의 한계
현재 42/42라는 결과는 Xiaohongshu가 발표한 데이터에 근거합니다. 회사는 AI가 생성한 해답을 공식 IMO 주최 측에 제출해 채점받았다고 밝혔지만, 이 주장을 완전히 검증하려면 외부 검토와 채점 과정에 관한 더 자세한 정보가 필요합니다. [3][2]
현재로서는 42/42라는 결과를 유망하지만 아직 확정되지 않은 것으로 보는 편이 합리적입니다. 소스 코드가 공개되고 외부 연구자들이 새로운 문제로 모델을 시험해 같은 성능이 유지되는지 확인하면 상황이 더 명확해질 것입니다.
dots-note-3.0이 수학적 추론을 개선하는 방식

최종 답변 전의 재귀적 자기 비평과 수정
dots-note-3.0은 중간 단계를 검증하기 위해 자연어 추론과 Python 검증을 결합합니다 [1]. 첫 시도에 머무르지 않고 반복적인 검토 주기를 거칩니다. 각 단계를 시험하고, 실수를 찾아내고, 최종 답을 내기 전에 증명을 다시 씁니다 [1]. 이것이 보고된 IMO 성과를 뒷받침하는 핵심 이유입니다.
IMO는 _완전한 증명_을 채점하므로 dots-note-3.0은 올바른 최종 답에 도달하는 데 그치지 않고 논증 전체의 논리를 지키도록 설계되었습니다 [1][2]. 이는 한 단계의 오류가 이후 모든 내용을 무너뜨릴 수 있는 정리형 문제에서 특히 중요합니다 [1][2].
재귀적 자체 검증이 가장 큰 도움이 되는 수학 분야
각 단계가 독립적으로 타당해야 하는 영역에서 가장 큰 향상이 나타납니다.
| 수학 분야 | dots-note-3.0의 접근 방식 | 구체적인 예시 |
|---|---|---|
| 올림피아드 증명 | 가정을 반복적으로 자체 검증 | 조합론 문제를 마무리하기 전에 빠진 경계 사례 식별 |
| 기호 대수학 | 단계 검증을 위한 Python 코드 실행 | 복잡한 다항식을 전개할 때 부호 오류 포착 |
| 기하 증명 | 기하학적 조건을 엄밀하게 검증 | 특정 삼각형의 성질을 증명하지 않은 채 가정했음을 발견하고 증명 수정 |
| 미적분학 | 여러 단계로 된 유도 과정 검증 | 중간 미분을 다시 계산해 잘못된 부분적분 단계 수정 |
추론 방식 비교표
다음 표는 이 접근법이 일반적인 추론 워크플로와 어떻게 다른지 보여줍니다.
| 추론 방식 | 강점 | 한계 | 가장 적합한 수학 과제 |
|---|---|---|---|
| 재귀적 자기 비평(dots-note-3.0) | 높은 엄밀성, 논리적 공백 식별, 반복적 자체 검증으로 중간 오류에서 회복 | 반복 작성으로 인해 연산 비용과 지연 시간이 증가 | 올림피아드형 증명, 복잡한 다단계 정리, 기하 증명 |
| 표준 Chain-of-Thought(CoT) | 간단한 문장제 문제의 성능 개선, 구현이 쉬움 | 논리적 단계를 지어낼 수 있으며 초반 단계가 틀리면 복구 불가 | 기초 산술, 간단한 대수 문장제 문제 |
| 도구 증강 추론 | Python을 통한 계산 정확도가 높고 복잡한 기호 조작 처리 가능 | 도구 출력의 품질은 도구를 호출하는 논리에 좌우되며 심층적인 논리 자체 검토가 부족 | 기호 대수학, 미적분 유도, 대량의 산술 계산 |
| 형식 증명 워크플로 | 형식 검증을 통해 절대적인 수학적 확실성 제공 | 형식 언어로 변환해야 하며 진입 장벽이 매우 높음 | 정리 증명, 교과서 연습 문제의 형식화 |
절충점은 단순합니다. 더 많은 연산량과 대기 시간을 들이는 대신 증명을 무너뜨리는 오류에 더 강하게 대비할 수 있습니다.
현재 AI 수학 연구에서 dots-note-3.0의 위치
자연어 증명과 형식 정리 증명의 차이
이 방식은 사람이 읽을 수 있는 증명과 기계가 검증하는 형식 증명의 중간 지점에 있기 때문에 중요합니다.
현재 AI 수학 연구에서는 이런 구분이 유용합니다. 한쪽에는 자연어 증명 시스템이 있습니다. 이 시스템은 글로 된 설명과 Python 같은 도구를 결합합니다. 다른 쪽에는 모든 단계를 Lean 같은 언어로 작성한 뒤 기계로 검증하는 형식 정리 증명기가 있습니다.
dots-note-3.0은 첫 번째 부류에 속합니다. 자연어 추론과 Python 검증을 함께 사용합니다. 흥미로운 점은 단지 정답에 도달한다는 것이 아닙니다. 최종 결과만 내놓는 상자처럼 작동하는 대신, 수학 추론을 읽을 수 있고 스스로 교정하는 증명 과정으로 바꿉니다.
이 차이는 중요합니다. 자연어 증명은 사람이 더 쉽게 따라갈 수 있습니다. 기계 검증이 목표라면 형식 증명이 더 강력합니다. 절충점은 명확합니다. 자연어 증명에는 형식 시스템이라면 즉시 찾아낼 작은 논리적 공백이 여전히 숨어 있을 수 있습니다.
하나의 헤드라인 결과를 넘어 중요한 벤치마크
벤치마크 선택에서도 같은 구분을 볼 수 있습니다.
IMO 결과는 강력하지만 하나의 벤치마크일 뿐입니다. 연구자들은 GSM8K, MATH500, AIME, MathVista, GPQA도 살펴봅니다. 각 벤치마크가 추론의 깊이, 기하, 시각 수학, 전문가 수준의 문제 해결 등 서로 다른 측면을 시험하기 때문입니다.
IMO의 두드러진 특징은 완전한 서면 증명을 채점한다는 점입니다. 사례 하나를 건너뛰거나 조건 하나를 명시하지 않아도 실제 감점으로 이어질 수 있습니다. 이는 최종 답만 확인하는 시험과 크게 다릅니다. 산술, 대수, 기하, 미적분, 증명 기반 작업을 목표로 하는 모델에는 IMO가 훨씬 더 어려운 목표인 이유입니다.
모델 및 벤치마크 비교표
아래 표는 현재 AI 수학 연구에서 dots-note-3.0이 어느 위치에 있는지 보여주는 다른 시스템들과 함께 비교합니다.
| 시스템 | 주요 과제 유형 | 핵심 벤치마크 | 출력 형식 | 보고된 강점 |
|---|---|---|---|---|
| dots-note-3.0 | 올림피아드 추론 | IMO 2026 (42/42) [1][2][4] | 자연어 + Python | 에이전트형 자기 비평 루프, 완전한 증명의 엄밀성 |
| Huawei Celia | 올림피아드 추론 | IMO 2026 (42/42) [3] | 수학 증명 | 여러 수학 분야를 아우르는 역량 |
| Moonshot AI Kimi K3 | 고급 추론 | IMO 2026 (42/42) [3] | 자연어 | 만점 기준 달성 |
| DeepMind/OpenAI (2025) | 올림피아드 추론 | IMO 2025 (35/42) [1][2][4] | 형식 언어 + 자연어 | 금메달 수준의 성능 |
가장 큰 차별점은 점수만이 아닙니다. 제출 전에 증명을 고치는 자기 비평 루프입니다. 바로 이 부분이 모델이 연구 및 제품 워크플로에 어떻게 적용되는지를 결정합니다.
연구자, 교육자, 학생, 개발자 및 APIMart 사용자에게 갖는 의미

교육, 연구, 소프트웨어 제품에서의 실용적인 사용 사례
dots-note-3.0의 가치는 더 높은 벤치마크 점수에 그치지 않습니다. 더 큰 강점은 자신의 추론을 검토하고 수정해 일상적인 워크플로를 더 안정적으로 만든다는 점입니다. 간단히 말해, 증명 수준의 추론을 연구, 교육, 소프트웨어에서 실제로 사용할 수 있는 형태로 바꿉니다.
연구자는 형식화 전에 이를 활용해 추측을 시험하고, 반례를 찾고, 증명의 각 단계를 강도 높게 검토할 수 있습니다. 자체 검증 루프가 논리적 공백과 누락된 조건을 줄이도록 설계되었기 때문에 중요합니다 [2][4].
교육자는 이 모델로 풀이 예시와 정답 해설을 만들 수 있습니다. 유도 과정을 따라가며 잘못된 단계를 찾아내고 수정된 풀이를 생성할 수 있습니다. 학생은 같은 기능을 반대 방향에서 활용할 수 있습니다. 답이 틀렸다는 사실뿐 아니라 왜 틀렸는지를 설명해 주는 튜터가 되는 것입니다 [2].
정량적 제품을 만드는 개발자에게는 정밀도와 일관된 형식이 필요합니다. 예를 들어 금융 SaaS 워크플로는 이 모델로 복리를 계산하거나, 1,000.25와 같은 미국식 숫자 표기를 유지하면서 구조화된 수치 출력을 반환할 수 있습니다 [2].
APIMart가 대규모 수학 추론 워크플로를 지원하는 방식
APIMart의 통합 API를 사용하면 여러 개의 별도 통합을 관리하지 않고도 팀이 수학 추론 워크플로를 더 쉽게 구축할 수 있습니다.
개발자에게 가장 큰 이점은 간편한 통합과 명확한 사용량 계획입니다. 여러 엔드포인트와 도구별 워크플로를 유지하는 대신, 하나의 API를 통해 요청을 보내고 제품에 필요한 형식으로 출력을 구성할 수 있습니다.
사용자 영향 매핑 표와 결론
이 워크플로는 정답만이 아니라 설명이 필요할 때 가장 중요합니다. 아래 표는 이러한 추론 방식이 각 사용자 집단과 어떻게 맞물리는지 보여줍니다.
| 사용자 집단 | 사용 사례 | 필요한 역량 | APIMart 흐름 |
|---|---|---|---|
| 연구자 | 정리 개요 작성 및 추측 검증 | 형식 논리 및 엄밀한 증명 생성 | 추론 모델 -> JSON 출력 -> LaTeX |
| 교육자 | 풀이 검토 및 채점 지원 | 단계별 오류 진단 | 학생 입력 -> 추론 모델 -> 피드백 |
| 학생 | 대화형 개인 지도 및 풀이 예시 | 자연어 수학 설명 | Chat API -> 단계별 추론 모드 |
| 개발자 | 정량적 SaaS 및 금융 워크플로 | 고정밀 수치 및 논리 분석 | 통합 API -> 구조화된 JSON(예:$1,250.00) |
RedNote는 구체적인 조건을 공개하지 않았지만 가까운 시일 내에 소스 코드를 공개할 계획이라고 발표했습니다 [2][4]. APIMart 사용자에게 매력적인 점은 제품 워크플로에 매끄럽게 들어가는 신뢰할 수 있는 단계별 추론입니다.
자주 묻는 질문
42/42 점수는 어떻게 검증되었나요?
42/42 점수는 dots-note-3.0이 작성한 전체 IMO 해답을 IMO 주최 측에 보내 사람이 채점하는 방식으로 확인했으며, 시험 중에는 사람이 전혀 개입하지 않았습니다.
점수는 최종 수치 답만이 아니라, 요구된 증명 단계 각각의 정확성과 완전성을 기준으로 산정되었습니다.
Python 검증으로 증명에서 무엇을 확인할 수 있나요?
dots-note-3.0에서 Python 검증은 모델이 작성한 추론 초안을 시험하고, 반박하고, 다듬어 증명이 얼마나 탄탄한지 확인하는 데 도움이 됩니다.
서면 증명을 약화할 수 있는 누락된 사례나 명시되지 않은 조건을 찾아낼 수 있습니다. 따라서 제출 전에 각 단계가 논리적으로 타당한지 검토할 수 있습니다.
dots-note-3.0으로 가장 큰 도움을 받을 수 있는 사람은 누구인가요?
dots-note-3.0은 어려운 문제를 다룰 때 엄밀하고 검증 가능한 정확성이 필요한 연구자, 교육자, 개발자에게 가장 적합합니다.
대수, 기하, 미적분, 형식 논리에서 신뢰할 수 있는 단계별 추론을 제공합니다. 따라서 작은 논리 오류나 명시되지 않은 조건도 큰 비용으로 이어질 수 있는 정리 기반 작업과 정량 분석에 잘 맞습니다.
모델 마켓에서 원하는 모델을 선택하세요
APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.