เข้าถึงเดโมฟรี 100%
เปิด Space อ้างอิงแบบฝังและทดลองเวิร์กโฟลว์ MiniMax H3 ที่พร้อมใช้งาน โดยไม่ต้องจ่ายเงินให้ Free Video AI ซื้อเครดิต หรือเริ่มสมัครสมาชิกที่นี่

ใช้ MiniMax H3 ได้ฟรีอย่างเต็มที่ผ่านเดโมแบบฝัง จากนั้นสำรวจตัวอย่างทางการและแนวทางติดตั้ง H3-Base แบบโอเพนซอร์ส สร้างวิดีโอมัลติโมดัลด้วยบริบทข้อความ รูปภาพ วิดีโอ และเสียง พร้อมเสียงสเตอริโอในตัวและเอาต์พุตสูงสุด 2K ในเวิร์กโฟลว์ H3 แบบสมบูรณ์
ทดลองใช้อินเทอร์เฟซอ้างอิง MiniMax H3 ที่ชุมชนเป็นผู้โฮสต์ได้โดยตรงด้านล่าง Free Video AI ไม่เรียกเก็บเครดิต ค่าสมัครสมาชิก หรือค่าการเข้าถึงสำหรับประสบการณ์แบบฝังนี้
เดโมนี้โฮสต์และดำเนินการโดย Hugging Face Space ภายนอก พรอมต์และสื่ออ้างอิงที่อัปโหลดจะได้รับการประมวลผลโดยบริการนั้น ไม่ใช่ในเครื่องโดย Free Video AI ความพร้อมใช้งาน คิว ข้อจำกัด การกลั่นกรอง และการจัดการข้อมูลอยู่ภายใต้การควบคุมของผู้ให้บริการ Space
เปิดเดโมในแท็บใหม่H3 รวมการทำความเข้าใจมัลติโมดัล การสร้างวิดีโอ การตัดต่อ และเสียงที่ซิงค์กันไว้ในระบบอเนกประสงค์เดียว แทนการแยกทุกงานสร้างสรรค์ไปใช้โมเดลคนละตัว
เปิด Space อ้างอิงแบบฝังและทดลองเวิร์กโฟลว์ MiniMax H3 ที่พร้อมใช้งาน โดยไม่ต้องจ่ายเงินให้ Free Video AI ซื้อเครดิต หรือเริ่มสมัครสมาชิกที่นี่
อธิบายว่าข้อความ รูปภาพ วิดีโออ้างอิง และเสียงเกี่ยวข้องกับเป้าหมายอย่างไร H3 ออกแบบมาให้เข้าใจความสัมพันธ์ทั้งหมดแทนที่จะประมวลผลแต่ละอินพุตแยกกัน
สร้างภาพและเสียงพร้อมกัน รวมถึงบทสนทนา เสียงแวดล้อม และดนตรี ด้วยเอาต์พุตสเตอริโอ 32 kHz ในตัวตามระบบ H3 ที่ระบุไว้ในเอกสาร
ข้อกำหนดทางการครอบคลุมเอาต์พุต 4–15 วินาที 24 FPS และอัตราส่วนภาพแนวนอน สี่เหลี่ยม แนวตั้ง และแบบภาพยนตร์ที่ใช้กันทั่วไป
ไปป์ไลน์ H3 แบบสมบูรณ์สามารถสร้างผลลัพธ์พื้นฐาน 768p ขึ้นใหม่ที่ 2K พร้อมนำบริบทมัลติโมดัลเดิมกลับมาใช้เพื่อคืนรายละเอียดเล็ก ๆ ได้อย่างเที่ยงตรงยิ่งขึ้น
นักพัฒนาสามารถดาวน์โหลดเช็กพอยต์ FL2VA และ Ref2VA H3-Base ตรวจสอบการทำงาน และสร้างเวิร์กโฟลว์สร้างวิดีโอ 768p แบบโฮสต์เอง
ต่อยอดจากการทดลองฟรีสู่งานโปรดักชันที่ทำซ้ำได้ด้วย API เฉพาะทางสามรูปแบบจาก Flaq AI สำหรับการสร้างวิดีโอจากข้อความ รูปภาพ และข้อมูลอ้างอิงหลายสื่อ
กำลังมองหาทางเลือกแทน Seedance 2.0 อยู่ใช่ไหม? MiniMax H3 รวมการควบคุมหลายสื่อ เสียงในตัว น้ำหนักโมเดล H3-Base แบบเปิด และตัวเลือก API สำหรับงานโปรดักชันไว้ในเวิร์กโฟลว์ที่ยืดหยุ่นเพียงหนึ่งเดียว
สร้างภาพเคลื่อนไหวจากรูปภาพต้นฉบับด้วยการเคลื่อนไหวตามพรอมต์ เสียงที่ซิงค์กัน และเวิร์กโฟลว์ API แบบมีการจัดการ เหมาะสำหรับภาพสินค้า ภาพบุคคล โฆษณา และแนวคิดด้านภาพ
สร้างคลิปภาพและเสียงจากพรอมต์โดยละเอียดผ่านเอนด์พอยต์ที่เสถียร ซึ่งออกแบบมาสำหรับระบบสร้างสรรค์อัตโนมัติที่ทำซ้ำได้และการผลิตวิดีโอที่ปรับขนาดได้
ใช้ข้อมูลอ้างอิงหลายสื่อเพื่อกำหนดอัตลักษณ์ สไตล์ภาพ การเคลื่อนไหว เสียงพูด และเสียงประกอบ เมื่องานโปรดักชันต้องการการควบคุมมากกว่าการสร้างด้วยพรอมต์เพียงอย่างเดียว
ความพร้อมให้บริการ ราคา ขีดจำกัดอัตราการเรียกใช้ และลักษณะการทำงานของโมเดลเป็นข้อมูลที่ Flaq AI กำหนดและอาจเปลี่ยนแปลงได้ โปรดตรวจสอบเอกสาร API และราคาปัจจุบันก่อนนำไปใช้ในงานโปรดักชัน
เอาต์พุต 768p ที่ทำซ้ำได้เหล่านี้มาจากคลัง GitHub ทางการของ MiniMax H3 และแสดงโหมดการสร้างหลักสามรูปแบบ
เปลี่ยนคำบรรยายฉากที่เขียนไว้ให้เป็นลำดับวิดีโอพร้อมเสียงที่สร้างร่วมกัน โดยใช้ตระกูลเช็กพอยต์ FL2VA
ดูซอร์สทางการบน GitHubกำหนดทิศทางการเคลื่อนไหวและองค์ประกอบด้วยรูปภาพศูนย์ หนึ่ง หรือสองภาพ สำหรับการสร้างข้อความเป็นวิดีโอ เฟรมแรก เฟรมสุดท้าย หรือทั้งเฟรมแรกและเฟรมสุดท้าย
ดูซอร์สทางการบน GitHubใช้รูปภาพอ้างอิง คลิปวิดีโอ และเสียงที่รองรับร่วมกัน เพื่อควบคุมอัตลักษณ์ การเคลื่อนไหว สไตล์ภาพ เสียงพูด และเสียงประกอบ
ดูซอร์สทางการบน GitHubวิดีโอตัวอย่างจัดทำโดย MiniMax-AI ในคลัง MiniMax-H3 ผลลัพธ์แตกต่างกันไปตามพรอมต์ สื่ออ้างอิง เช็กพอยต์ การตั้งค่าอนุมาน ฮาร์ดแวร์ และเวิร์กโฟลว์
ระบบ H3 ตามเอกสารแยกการตีความบริบทเชิงลึก การสร้างภาพพร้อมเสียงพื้นฐาน และการสร้างความละเอียดสูงขึ้นใหม่ โดยยังคงบริบทการสร้างสรรค์เดิมตลอดเวิร์กโฟลว์

ภาษาทำหน้าที่เป็นสะพานเชื่อมพรอมต์กับสื่อผสม โดยอธิบายความสัมพันธ์ระหว่างตัวแบบ ช็อต การเคลื่อนไหว เสียง และเอาต์พุตเป้าหมาย
ระบบประมวลผลล่วงหน้าที่โฮสต์ไว้ตีความคำสั่งมัลติโมดัลแบบอิสระและแปลงเป็นการแทนข้อมูลแบบมีโครงสร้างสำหรับการสร้าง
โมเดลพื้นฐานแบบเปิดคาดการณ์ค่าศักย์ของภาพและเสียงร่วมกันผ่าน H3-Omni Transformer อเนกประสงค์ และสร้างเอาต์พุตภาพพร้อมเสียง 768p
โมดูลสุดท้ายนำทั้งผลลัพธ์พื้นฐานและบริบทเดิมกลับมาใช้เพื่อสร้างรายละเอียดความละเอียดสูงขึ้นใหม่ แทนที่จะใช้เพียงซูเปอร์รีโซลูชันแบบทั่วไป
ใช้เวิร์กโฟลว์มัลติโมดัลเดียวเพื่อสำรวจแนวคิดเชิงพาณิชย์ ฉากเล่าเรื่อง การออกแบบแบรนด์ ข้อมูลอ้างอิงการเคลื่อนไหว และไอเดียภาพพร้อมเสียงที่ซิงค์กัน
สร้างต้นแบบโฆษณาสินค้า แนวคิดแคมเปญ ภาพเปิดตัว ภาพสินค้า และโฆษณาโซเชียล ด้วยความสามารถทำตามคำสั่งและแสดงข้อความที่ดียิ่งขึ้น
เปลี่ยนคำบรรยายฉาก ภาพตัวละคร ข้อมูลอ้างอิงการเคลื่อนไหว และแนวทางด้านเสียง ให้เป็นงานศึกษาสั้น ๆ แบบภาพยนตร์ก่อนเริ่มผลิต
สำรวจอัตลักษณ์แบบเคลื่อนไหว แนวคิดเว็บไซต์ผลิตภัณฑ์ ลำดับไตเติล โปสเตอร์เคลื่อนไหว และระบบภาพของแบรนด์
ถ่ายโอนการเคลื่อนไหว รักษาตัวแบบ อ้างอิงสไตล์ภาพ หรือใช้บริบทเสียงและวิดีโอเพื่ออธิบายการแปลงแบบเจาะจง
พัฒนาช่วงเวลาของตัวละคร อินโทรเกม หนังสั้น 3D มีสไตล์ โปสเตอร์เคลื่อนไหว และการทดลองด้านภาพในแนวทางศิลปะที่หลากหลาย
ทดลองแนวคิดภาพและเสียงแบบสั้น ด้วยการรองรับบทสนทนาอย่างเสถียรใน 11 ภาษาตามเอกสาร และภาษาอื่น ๆ ในระดับคุณภาพที่แตกต่างกัน
เริ่มจากเดโมแบบฝัง ระบุความสัมพันธ์เชิงสร้างสรรค์ระหว่างสื่ออ้างอิงแต่ละรายการให้ชัดเจน และตรวจสอบผลลัพธ์ภาพและเสียงทั้งหมด
เปิด Space แบบฝังแล้วเลือกเวิร์กโฟลว์ข้อความ เฟรมแรก/สุดท้าย หรือข้อมูลอ้างอิงมัลติโมดัลที่พร้อมใช้งาน
เขียนพรอมต์ที่แม่นยำและเพิ่มสื่ออ้างอิงที่รองรับ อธิบายว่ารูปภาพ วิดีโอ เสียงพูด การเคลื่อนไหว เสียง หรือสไตล์ใดควรส่งผลต่อเป้าหมาย
ส่งงาน รอคิวของบริการที่โฮสต์ แล้วตรวจสอบการเคลื่อนไหว อัตลักษณ์ ข้อความ บทสนทนา เอฟเฟกต์เสียง ดนตรี และการทำตามคำสั่งโดยรวม
คลังทางการมีเช็กพอยต์ FL2VA และ Ref2VA พร้อมแนวทางสำหรับ SGLang, vLLM, diffusers และ ComfyUI เริ่มด้วยเวิร์กโฟลว์ H3-Base 768p ในเครื่อง แล้วค่อยขยายหลังจากตรวจสอบฮาร์ดแวร์และกรณีใช้งานแล้ว
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" \
--local-dir MiniMax-H3
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 --ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 --port 30010 \
--model-variant fl2va
อ่าน Community License คำแนะนำในคลัง ขนาดเช็กพอยต์ และข้อกำหนด GPU เฉพาะเฟรมเวิร์กก่อนดาวน์โหลดน้ำหนักโมเดล
ใช้ FL2VA สำหรับการสร้างจากข้อความและเฟรมแรก/สุดท้าย หรือใช้ Ref2VA เมื่อเวิร์กโฟลว์ต้องการข้อมูลอ้างอิงรูปภาพ วิดีโอ และเสียงผสมกัน
จำกัดการดาวน์โหลดจาก Hugging Face ไว้ที่ตระกูลงานเดียว หรือให้ diffusers ดึงองค์ประกอบที่จำเป็นเพื่อลดพื้นที่จัดเก็บและเวลาในการตั้งค่า
เริ่มเฟรมเวิร์กที่เลือก ทำซ้ำกรณีทางการ เปรียบเทียบเอาต์พุตภาพและเสียง แล้วตัดสินใจว่าจะผสานเวิร์กโฟลว์ 2K ที่โฮสต์ไว้หรือไม่
สำคัญ: น้ำหนักแบบเปิดไม่ได้ทำให้การประมวลผล GPU ฟรี โปรดอ่าน MiniMax H3 Community License ก่อนติดตั้ง รุ่นแบบเปิดปัจจุบันมี H3-Base ส่วน H3-Context-IR และ H3-Regenerate-2K เป็นองค์ประกอบที่โฮสต์ไว้ซึ่งใช้ในเวิร์กโฟลว์ 2K ทางการแบบเต็ม
หลังจากสร้างคลิป H3 แล้ว ให้เพิ่มความละเอียดสำหรับทำงานในเครื่อง แก้การวางแนว หรือตัดไฮไลต์ให้สั้นลงด้วยเครื่องมืออื่นในชุด
สร้าง
ทดลองเดโม H3 มัลติโมดัลที่โฮสต์ไว้ ชมตัวอย่างทางการ และทำตามแนวทางติดตั้ง H3-Base แบบเปิด
เปิดเครื่องมือฟรีเพิ่มคุณภาพ
เพิ่มความละเอียดวิดีโอเป็น 2× หรือ 4× ด้วยการประมวลผลส่วนตัวภายในเครื่อง และเลือกใช้โครงข่ายประสาท WebGPU เพื่อเพิ่มคุณภาพได้
เปิดเครื่องมือฟรีกระจกเงา
พลิกวิดีโอในแนวนอน แนวตั้ง หรือทั้งสองวิธีด้วยการดูตัวอย่างแบบส่วนตัวและส่งออกเบราว์เซอร์ในเครื่อง
เปิดเครื่องมือฟรีตัด
เลือกเวลาเริ่มต้นและเวลาสิ้นสุดที่แน่นอน ดูตัวอย่างแหล่งที่มา และส่งออกคลิปที่โฟกัสโดยไม่ต้องอัปโหลด
เปิดเครื่องมือฟรีอ่านแหล่งข้อมูลต้นฉบับต่อเกี่ยวกับการเปิดตัว การนำไปใช้แบบเปิด เช็กพอยต์ เวิร์กโฟลว์ และสัญญาอนุญาตของโมเดล
อ่านคำอธิบายจาก MiniMax เกี่ยวกับบริบทมัลติโมดัล เสียงสเตอริโอในตัว H3-VAE, Omni Transformer และการสร้างใหม่ 2K ภายในบริบท
เปิดแหล่งข้อมูลแหล่งข้อมูลทางการตรวจสอบโครงสร้างเช็กพอยต์ โหมดอินพุตที่รองรับ คำสั่งติดตั้ง กรณีที่ทำซ้ำได้ ทักษะการเขียนพรอมต์ และขอบเขตโอเพนซอร์สปัจจุบัน
เปิดแหล่งข้อมูลแหล่งข้อมูลทางการตรวจสอบรุ่นทางการบน Hugging Face ไฟล์โมเดล Community License และคำแนะนำการโหลดเฉพาะเฟรมเวิร์กก่อนติดตั้ง
เปิดแหล่งข้อมูล