跳至主要內容
Buzzdope Buzzdope
#人工智慧#大模型#數學競賽#小紅書

小紅書自研大模型奪 IMO 滿分金牌:純自然語言推理如何顛覆 AI 評測邏輯

Buzzdope 編輯室
小紅書自研大模型奪 IMO 滿分金牌:純自然語言推理如何顛覆 AI 評測邏輯

在 2026 年國際數學奧林匹克競賽(IMO)成績公布中,小紅書自研大模型 dots-note-3.0 以六題全對的滿分成績斬獲金牌,成為繼谷歌 Gemini 之後,全球第二個在該項賽事達到此水準的人工智慧模型,更是中國首個獲得 IMO 官方金牌水平認證的大模型。

關鍵事實

  • 參賽模型:小紅書自研大模型 dots-note-3.0。
  • 競賽成績:在 2026 年國際數學奧林匹克競賽(IMO)中,六道題目全部答對,獲得 42 分滿分金牌。
  • 產業定位:這是中國大模型首次獲得 IMO 官方金牌水平認證,也是繼谷歌 Gemini 之後,全球第二個達到該成績的大模型。
  • 解題特徵:模型僅使用自然語言,完成從讀題、解析到撰寫證明的全過程,未依賴 Lean 等形式化語言輔助,且在第三題等特定題目提出了非常規解法。
  • 專家評價:雙 CMO(中國數學奧林匹克)金牌得主劉涵祚與 CMO 金牌得主汪千桐均公開肯定其解題邏輯,認為其證明過程結構緊湊且直擊問題本質。

為何一個生活社羣平臺要拼數學奧林匹亞

大模型參與數學競賽的熱潮,核心在於數學推理是檢驗人工智慧底層智力最直觀的試金石。國際數學奧林匹克競賽(IMO)匯聚全球頂尖中學生,比賽分兩天進行,每天限時 4.5 小時完成 3 道題。題目涵蓋代數、組合、幾何與數論。參賽者若想拿分,不能僅提供最終答案,必須寫出邏輯完整且能接受逐步審查的證明過程。

過去幾年,全球科技巨頭無不將 IMO 視為大模型推理能力的終極考場。2024 年,谷歌 Gemini 首次挑戰 IMO,最終以 28 分達到銀牌水平。當時的系統高度依賴將自然語言翻譯成 Lean 等形式化電腦語言,部分題目甚至耗時數天才能完成證明。隔年 Gemini 捲土重來,才真正以自然語言端到端完成證明,在 4.5 小時內解出 5 道題獲得金牌。

統計圖卡呈現小紅書大模型在國際數學奧林匹克競賽拿下四十二分滿分

相較之下,小紅書這次以 dots-note-3.0 模型首次參與世界級賽事,直接以全對成績奪金。值得注意的是,過去外界對小紅書的技術認知多停留在生活社羣與推薦演算法層面,這次滿分奪金,顯示其內部研發能量在通用大模型與複雜推理領域已取得實質突破。這也說明,當演算法發展到一定瓶頸時,各家科技巨頭與獨角獸新創無不試圖透過極致的硬核任務來建立技術壁壘。這與我們先前分析的存儲晶片定價權之爭背後的產業邏輯相似,核心技術的底層攻堅能力,決定了企業在下一輪技術週期的話語權。

擺脫程式碼輔助與未公開題庫的測驗價值

大模型在 IMO 取得滿分的難度極高,原因在於賽事的嚴謹性與未知性。在當今的模型訓練環境中,一旦數據出現在網際網路上,很快就會被爬蟲抓取並用於模型訓練。這導致許多標準化測試集失去鑑別力。IMO 的價值在於賽題由專家命制且嚴格保密,模型無法提前獲取原題進行針對性訓練。

官方測評採用嚴格的當屆賽事流程。每個比賽日的學生考試結束後,模型團隊才會收到當天題目,並必須在規定期限內提交 PDF 答案。這種機制確保了測試結果反映的是模型真正的獨立推理能力,而非對海量題庫的記憶檢索。

除了滿分成績,dots-note-3.0 的答題方式也引發關注。不同於早期模型需要將數學問題轉化為程式碼或形式化邏輯語言來驗證,該模型全程僅使用自然語言進行推演。這代表模型本身已具備深度的語義理解與邏輯推導能力。在第三題的解答中,模型提出了一條非標準的切入路徑。

條列式清單詳細說明人工智慧模型參與國際數學奧林匹亞競賽必須遵守的四項嚴格測驗規範

曾獲雙 CMO 金牌的選手劉涵祚在檢視模型的證明過程後指出,這條思路正確且結構緊湊,邏輯推演自然。即使放在人類選手的 IMO 解答中,也屬於較為簡潔的類型。另一位 CMO 金牌得主汪千桐也給出類似結論,他認為常規解法已經相當巧妙,但該模型直接攻克了題目最本質的部分,思路相當直觀。

從競賽打榜邁向科學研究輔助

大模型在數學競賽的成績不斷突破,其最終目的並非為了贏得獎牌,而是為了進軍科學研究的深水區。數學是所有科學與工程的基礎,大模型在此類競賽中走得越遠,代表其底層邏輯探索能力越強。這對於推動材料科學、生物製藥以及物理理論等需要大量複雜運算的領域,具有直接的應用價值。

以本週另一項人工智慧界的進展為例,模型 Fable 5 參與構造了一個雅可比猜想的反例。該猜想自 1939 年提出以來懸而未決,曾讓許多頂尖數學家無功而返。雖然這項由 AI 找出的反例尚未經過正式的同行評審,但它清楚地表明,現階段大模型的能力已經足以參與真正的數學發現過程,提供人類學者過去未曾設想過的視角。這種演進脈絡,就如同社羣平臺為解決青少年沉迷問題而祭出Twitch 推出全新家長控制功能一樣,都是科技發展從粗放擴張走向精細化治理的必然階段。

引述中國數學奧林匹克雙金牌得主劉涵祚對於大模型解題邏輯緊湊且優雅的評價

數學競賽正是模型進入高階科研領域前,那道最硬核的能力門檻。當大模型能夠在嚴格限時且未知的條件下,透過自然語言完成嚴謹的數學證明,這意味著人工智慧在處理開放性問題、非結構化數據以及多步驟邏輯推演方面,已經達到了新的技術拐點。未來,這些具備高階推理能力的模型,將有機會成為研究機構與企業研發部門的核心基礎設施,改變傳統的知識生產與問題解決模式。

常見問題 FAQ

Q:國際數學奧林匹克競賽(IMO)的計分方式為何? A:比賽分兩天進行,每天須在 4.5 小時內完成 3 道題,總計 6 道題。題目涵蓋代數、組合、幾何和數論。每題滿分為 7 分,總分為 42 分。參賽者必須提供邏輯完整的證明過程才能獲得滿分。

Q:為什麼大模型需要參加數學奧林匹亞競賽? A:數學競賽的題目未曾公開於網路,模型無法透過事先訓練題庫來作弊。透過解決未知的數學難題,可以直接檢驗大模型的底層智力、邏輯推理與獨立探索能力,這已成為業界公認的 AI 實力測試標準。

Q:小紅書的 dots-note-3.0 模型與過去參賽的 AI 有何不同? A:過去如谷歌的模型在參賽時,需要將題目轉換為 Lean 等形式化語言來輔助解題,耗時較長。dots-note-3.0 全程僅使用自然語言進行讀題、解析與證明,且在部分題目上提出了不同於常規的簡潔解法。

結論

小紅書大模型 dots-note-3.0 在 2026 年國際數學奧林匹克競賽中以滿分奪金,證明了其自然語言處理與複雜邏輯推演的硬實力。這項成果打破了過往由少數海外科技巨頭壟斷 AI 數學推理榜首的局面,也凸顯了未公開題庫與嚴格限時測試在當代 AI 評測中的關鍵地位。當大模型能夠以極為精煉的邏輯攻克高難度數學本質問題,意味著人工智慧正從單純的數據生成,大步邁向協助人類進行前沿科學探索的新階段。