Kimi K3 模型亮相:挑戰智慧新高度,開源架構揭示未來可能性

| FinStack

Kimi K3 模型亮相:挑戰智慧新高度,開源架構揭示未來可能性

2026 年的科技浪潮中,Kimi 正式推出了其迄今為止能力最強大的模型 Kimi K3。這款模型承載著「犯其至難而圖其至遠者,發之以勇,守之以專,達之以強」的信念,以 2.8 兆參數的規模,預示著智慧科技的新里程碑。Kimi K3 的核心是其獨特的 KDA 混合線性注意力機制(Kimi Delta Attention)與注意力殘差(Attention Residuals)技術,原生支援視覺理解,並具備高達百萬個 token 的上下文窗口。它不僅是全球首個開源的 3 兆級別模型,更專為長程程式設計、知識密集型工作和複雜推論等前沿智慧場景而設計。

儘管 Kimi K3 的整體表現在某些方面仍稍遜於領先的閉源模型 Claude Fable 5 和 GPT-5.6 Sol,但其在 Kimi 公司內部全面的評測中展現出前沿水平的能力,並穩定地超越了其他所有模型。這項發布僅是開端,Kimi 團隊承諾將持續挖掘 K3 模型的潛力,不斷提升其在實際任務中的性能表現。

自即日起,使用者可透過多種管道體驗 Kimi K3 模型,包括 kimi.com 網站、最新版 Kimi 手機應用程式、最新版 Kimi Work 桌面客戶端、Kimi Code 以及 Kimi API。目前模型預設的思考強度為「max」(極致),未來更新將會增加「low」和「high」兩種模式,以提供更彈性的使用選擇。為確保模型在整個生態系統中穩定可靠地運行,Kimi 目前正與推論合作夥伴及開源維護者密切協作,對齊技術細節。完整的模型權重預計將於 2026 年 7 月 27 日前發布,而關於其架構、訓練方法和評測結果的更多詳情,也將隨 Kimi K3 技術報告同步公佈。

3 兆級開源模型:Kimi K3 的核心技術突破

Kimi K3 是全球首個達到 2.8 兆參數規模的開源模型,這標誌著 Kimi 在推動模型規模邊界上的最新成就。在過去 12 個月中的九個月裡,Kimi 的模型始終保持著開源模型規模的上限,展現了其在該領域的持續領導力。

Kimi K3 的基礎是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)這兩項關鍵架構創新。這些技術的引入,旨在確保資訊在更長序列和更深層的模型中能夠更順暢地流動。此外,Kimi 也進一步擴大了專家混合(Mixture of Experts, MoE)的稀疏度。結合 Stable LatentMoE 框架,模型能夠在 896 個專家中高效激活 16 個。透過這些結構性改進,加上訓練方法和數據配方的最佳化,Kimi K3 相較於前一代 K2 模型,整體擴展效率提升了約 2.5 倍,能更有效地將算力轉化為實際能力。

程式設計領域的卓越表現

Kimi K3 在長程編碼能力上展現出驚人的實力。在極少人工監督的情況下,它能夠持續完成長時間的工程任務,深入理解並處理大型程式碼庫,並協調使用終端工具。

Kimi K3 也特別擅長結合軟體工程與視覺推論的任務。它能夠利用螢幕截圖和視覺回饋來優化遊戲開發、前端介面設計和 CAD 等多種應用場景。以下案例更具體地展示了 Kimi K3 如何將其編碼能力轉化為開放式軟體開發與科學研究的有效解決方案。

Kernel 最佳化

為驗證 Kimi K3 深度優化 GPU 核心的能力,Kimi 團隊建立了一個核心優化競技場。每個模型在獨立的 GPU 沙盒中運行,任務、測試框架和生產負載完全一致。在最長 24 小時內,模型必須分析現有實現、重寫核心,並反覆執行效能測試以驗證成果。

競技場涵蓋兩種硬體平台、三類核心和四個任務:在 NVIDIA H200 GPU 上的注意力殘差(Attention Residuals)、KDA 線性注意力、一個從零實作的 512 頭維度 MLA 核心,以及一個在某國產 GPU 上的 KDA 任務。在最大思考強度下,Kimi K3 的表現接近 Fable-5(包含回退機制),並明顯領先於 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。

GPU 編譯器開發

Kimi 團隊進一步測試了 Kimi K3 是否能從零開始構建一套 GPU 程式設計系統。令人驚訝的是,Kimi K3 開發出了 MiniTriton:一款緊湊的類 Triton 編譯器。它基於 MLIR 構建了屬於自己的 tile 級別中間表示層,並實作了完整的優化通道(Optimization Pass)與 PTX 程式碼生成流水線。

在使用其支援的 Roofline 基準測試中,MiniTriton 的性能達到或超越了 Triton 和 torch.compile,在部分工作負載上甚至優於 Triton。除了微基準測試,MiniTriton 還能穩定支撐端到端的 nanoGPT 訓練。訓練過程穩定收斂,損失曲線與參考實作基本一致,僅存在輕微偏差,這驗證了整套流水線在真實工作負載下的有效性。

這些結果表明,Kimi K3 能夠構建一套完整且自洽的端到端編譯器系統——涵蓋 DSL 前端、中間表示優化、PTX 程式碼生成與運行時,而不僅僅是編寫孤立的算子核心。其從零實作的 Tensor Core 路徑,已經能夠與經過長期深度優化的 Triton 技術棧相媲美。

作為端到端驗證,團隊使用 TensorLite 訓練了 nanoGPT,並觀察到其正常收斂。這說明 Kimi K3 不僅僅是生成幾個孤立核心,而是搭建了一套真正可用的編譯器堆疊,包括程式設計抽象、中間表示、優化傳遞、後端程式碼生成,以及接入真實訓練負載的能力。

晶片設計

在早期概念驗證階段,Kimi K3 成功設計了一款晶片,用於運行一個基於其自身架構構建的 nano 模型。在連續 48 小時的自主 Agent 運行中,K3 運用開源 EDA 工具和 Nangate 45nm 工藝庫,獨立完成了晶片的構建、最佳化與驗證。這款晶片面積為 4 平方毫米,集成了 146 萬個標準單元、0.277 MB 的 SRAM 以及帶融合反量化的 INT4 MAC 陣列,在 100 MHz 下實現了時序收斂,模擬解碼吞吐量持續超過每秒 8,700 個 token。這顆由模型設計、為模型服務的晶片,正是 K3 長程 Agent 能力的真實寫照。一支由接入 Blender MCP 的 Kimi K3 模型生成的影片,也清晰地展示了這一成果。

科研程式設計

Kimi K3 能夠打通科學文獻與可執行程式碼之間的隔閡,自主完成複雜計算研究流程的實作、驗證和分析。

在一個案例中,Kimi K3 用約兩小時完成了通常需要一名資深研究人員一到兩週才能完成的工作。為重現計算天體物理中的 I-Love-Q 普適關係,它閱讀並交叉驗證了逾 20 篇論文,實作了完整的數值流程,評估了 300 多種狀態方程,發現了已發表公式中的不一致之處,生成了 3,000 多行 Python 程式碼,並產出一個用於探索結果的互動式 HTML 數據儀表板。

知識工作領域的突破

Kimi K3 大幅推動了端到端知識工作的進展。除了公開基準測試外,Kimi K3(max)在 Kimi 內部的評測中也展現出穩定的提升。這些評測源於真實使用者與智能體協作流程中反覆出現的任務模式和挑戰。Kimi K3 在不同生產場景導向的工作流程中都展現出一致的優勢,顯示其智能體知識工作能力獲得了全面提升。

研究及其視覺化

以下是一些例子,展示 Kimi Work 中的 K3 在金融諮詢和科研場景中能完成的工作:

  • 推論晶片行業研究: K3 經過 120 多輪遞歸自我改進,生成了一份覆蓋 ASIC 行業 42 年歷史的深度報告。K3 將證據轉化為定制圖表、動畫示意圖和互動式視覺敘事。整個過程中,它完成了超過 2800 次的網頁搜尋與抓取,執行了逾 1100 次終端數據提取,處理了 87 份季報和 99 份原始 PDF 文件,總計超過 11000 頁資料。目前已可查看完整的互動式報告。
  • 可控核融合產業研究: K3 製作了一份諮詢報告風格的行業研究,報告中包含時間軸、樹狀圖、瀑布圖、甘特圖,以及達到發布品質的演示文稿。
  • GWTC-5 引力波分析: Kimi K3 執行了一次針對 391 個引力波事件的分析,使用了 20 多個並行子智能體 (subagents),產出 7 張科學視覺化圖、2 張表格,並綜合了 10 多篇論文的文獻內容。

小組件和看板

在 Kimi Work 中,Kimi 推出了兩項新功能:小組件(Widgets)和看板(Dashboard),旨在讓使用者與 Kimi K3 的互動更加視覺化且具備持續性。小組件可以在對話中直接生成互動式元件,並可連結本地數據或外部插件,實現持續更新。看板則能將使用者最關心的小組件匯總到一個長期保留的個性化視圖中,並圍繞特定主題、專案或目標進行組織。

影片剪輯

Kimi K3 在動作設計、動畫製作和影片剪輯方面表現出色,主要得益於其原生的多模態架構,使其能夠在同一個模型中理解文字、圖像和影片。

在一個案例中,K3 曾製作了一支介紹自身架構的「3Blue1Brown」風格動態圖形講解影片,將複雜的技術概念轉化為易於理解的視覺內容。這再次證明了 Kimi K3 不僅僅是程式碼和數據處理的工具,更能在創意和視覺傳達領域展現其強大能力。

熱門文章