H3到底是什麼:同時理解文字、圖像、影音

MiniMax把H3稱為通用全模態生成系統。它可接收文字、圖片、影片與音訊,再產生附原生立體聲的影片。官方完整系統宣稱最高2K、4至15秒、24fps,音訊為32kHz立體聲,穩定支援中、英、日、韓等11種對話語言,並具首尾幀與多種參考素材控制。

搜尋升溫的直接觸發:從宣布到權重落地

7月31日官方文章先公開H3,表示模型可生成最長15秒、最高2K且帶原生立體聲的影片,並承諾未來幾日釋出權重。Hugging Face上的MiniMax-H3頁面隨後提供模型檔、說明與社群授權,授權文件標示日期為8月2日;權重上線後,開發者即可開始評估本機部署。相較模糊傳聞,這是一條可由官方頁與實際下載頁互相印證的事件鏈。

「完整H3」和「公開的H3-Base」不能混為一談

完整流程由H3-Context-IR、H3-Base及H3-Regenerate-2K三部分構成。公開權重的核心是H3-Base,可在本機產生預設短邊768像素的影音;負責複雜提示理解與整理的Context-IR仍是託管服務,H3-Regenerate-2K也尚未公開權重。這不等於官方2K功能尚未提供,因為託管API仍支援2K。官方還說初始公開版本只提供full attention推論,原生稀疏注意力實作將來再發布。因此「H3已完整開源、離線即可重現官方2K結果」是不準確的說法。

技術規模與使用成本都不能忽略

模型卡描述H3-Omni-Transformer為約330億參數的密集單流Transformer,使用Qwen3-VL-32B作為編碼器基礎。FL2VA檢查點處理文字及首/尾幀,Ref2VA處理多模態參考。大型影音模型需要可觀的顯示記憶體與推論時間;別人能「本機跑」不代表一般電腦能快速輸出15秒影片。

為何美國熱搜特別值得注意:授權明文排除美國

MiniMax H3採自訂Community License,而非Apache、MIT等標準開源授權。文件把美國、歐盟、英國與韓國列為Excluded Territories;這份公開權重的一般授權只適用於其他地區,排除地區的組織若要部署權重,需聯絡MiniMax取得正式授權。官方授權問答另說明,託管API仍可全球使用,因此地域排除不能被解讀成整個H3服務都在美國不可用。條款也限制用H3輸出改善其他AI模型,並要求公開發布機器生成內容時清楚揭露。這是條款整理而非法律意見,下載或部署前仍應查閱最新LICENSE與所在地規範。

創作者現在能做什麼,又該保留什麼

使用者可透過官方API或海螺AI測試託管服務;符合公開權重授權適用地區與用途的開發者,另可下載H3-Base配合Diffusers、SGLang、vLLM、ComfyUI評估本機部署。採公開權重路線者應先核對所在地、用途與下游條款,再評估硬體。至於「業界最佳」等宣稱主要來自廠商,在獨立評測前不宜寫成公認結論。

結語

MiniMax H3的吸引力在於把多模態參考、畫面與原生立體聲放進同一生成流程,而這波熱度的真正轉折是模型權重開始公開。然而可下載的H3-Base不等於完整2K服務,Community License也不等於無地域限制的標準開源授權。美國讀者若要自行部署權重,第一步是先確認授權;若使用官方託管API,則應依API條款判斷。技術能力、部署成本與法律範圍三者缺一不可。

資料來源

  1. Google Trends(榜單條件)
  2. MiniMax官方H3發布文章
  3. MiniMax H3官方模型頁
  4. MiniMax H3 Community License
  5. MiniMax影片API文件
  6. MiniMax H3授權問答