Truy cập bản demo miễn phí 100%
Mở Space tham khảo được nhúng và thử quy trình MiniMax H3 hiện có mà không phải trả tiền cho Free Video AI, mua tín dụng hay đăng ký thuê bao tại đây.

Sử dụng MiniMax H3 hoàn toàn miễn phí qua bản demo nhúng, sau đó khám phá các ví dụ chính thức và lộ trình triển khai H3-Base mã nguồn mở. Tạo video đa phương thức bằng ngữ cảnh văn bản, hình ảnh, video và âm thanh, âm thanh nổi nguyên bản cùng đầu ra lên đến 2K trong quy trình H3 hoàn chỉnh.
Trải nghiệm giao diện tham khảo MiniMax H3 do cộng đồng lưu trữ ngay bên dưới. Free Video AI không tính tín dụng, phí đăng ký hay phí truy cập cho trải nghiệm nhúng này.
Bản demo này do một Hugging Face Space bên ngoài lưu trữ và vận hành. Lời nhắc và nội dung tham chiếu đã tải lên được dịch vụ đó xử lý, không phải xử lý cục bộ bởi Free Video AI. Tình trạng hoạt động, hàng đợi, giới hạn, kiểm duyệt và cách xử lý dữ liệu do nhà cung cấp Space kiểm soát.
Mở bản demo trong thẻ mớiH3 hợp nhất khả năng hiểu đa phương thức, tạo video, chỉnh sửa và âm thanh đồng bộ trong một hệ thống đa dụng, thay vì tách từng tác vụ sáng tạo sang một mô hình khác nhau.
Mở Space tham khảo được nhúng và thử quy trình MiniMax H3 hiện có mà không phải trả tiền cho Free Video AI, mua tín dụng hay đăng ký thuê bao tại đây.
Mô tả mối liên hệ giữa văn bản, hình ảnh, video tham chiếu, âm thanh và kết quả đích. H3 được thiết kế để hiểu toàn bộ mối quan hệ thay vì xử lý từng đầu vào riêng biệt.
Tạo hình ảnh và âm thanh đồng thời, bao gồm lời thoại, hiệu ứng môi trường và nhạc, với đầu ra âm thanh nổi 32 kHz nguyên bản trong hệ thống H3 được ghi lại.
Thông số chính thức bao gồm đầu ra dài 4–15 giây, 24 FPS và các tỷ lệ khung hình ngang, vuông, dọc, điện ảnh phổ biến.
Quy trình H3 hoàn chỉnh có thể tái tạo kết quả nền 768p ở 2K, đồng thời tái sử dụng ngữ cảnh đa phương thức ban đầu để khôi phục chi tiết nhỏ trung thực hơn.
Nhà phát triển có thể tải xuống các checkpoint FL2VA và Ref2VA H3-Base, xem xét cách triển khai và xây dựng quy trình tạo 768p tự lưu trữ.
Chuyển từ thử nghiệm miễn phí sang quy trình production có thể lặp lại với ba endpoint chuyên biệt của Flaq AI dành cho việc tạo video từ văn bản, hình ảnh và tham chiếu đa phương thức.
Bạn đang tìm giải pháp thay thế Seedance 2.0? MiniMax H3 kết hợp khả năng điều khiển đa phương thức, âm thanh gốc, trọng số H3-Base mở và các lựa chọn API cho production trong một quy trình linh hoạt.
Tạo chuyển động cho hình ảnh nguồn bằng chuyển động theo prompt, âm thanh đồng bộ và quy trình API được quản lý, phù hợp với hình ảnh sản phẩm, chân dung, quảng cáo và ý tưởng hình ảnh.
Tạo trực tiếp các clip nghe nhìn từ prompt chi tiết qua một endpoint ổn định, được thiết kế cho hoạt động sáng tạo tự động có thể lặp lại và sản xuất video có khả năng mở rộng.
Dùng tham chiếu đa phương thức để định hướng danh tính, phong cách hình ảnh, chuyển động, giọng nói và âm thanh khi quy trình production cần khả năng kiểm soát cao hơn so với chỉ tạo bằng prompt.
Khả năng cung cấp API, mức giá, giới hạn tần suất và hành vi của mô hình do Flaq AI quy định và có thể thay đổi. Hãy xem tài liệu API và bảng giá hiện hành trước khi sử dụng cho production.
Các đầu ra 768p có thể tái tạo này đến từ kho GitHub chính thức của MiniMax H3 và minh họa ba chế độ tạo cốt lõi.
Biến mô tả cảnh viết thành chuỗi video có âm thanh được tạo đồng thời bằng dòng checkpoint FL2VA.
Xem nguồn chính thức trên GitHubĐịnh hướng chuyển động và bố cục bằng không, một hoặc hai hình ảnh cho chế độ văn bản thành video, khung hình đầu, khung hình cuối hoặc khung hình đầu và cuối.
Xem nguồn chính thức trên GitHubKết hợp hình ảnh tham chiếu, đoạn video và âm thanh được hỗ trợ để điều khiển danh tính, chuyển động, phong cách hình ảnh, giọng nói và âm thanh.
Xem nguồn chính thức trên GitHubVideo ví dụ do MiniMax-AI cung cấp trong kho MiniMax-H3. Kết quả thay đổi tùy theo lời nhắc, nội dung tham chiếu, checkpoint, thiết lập suy luận, phần cứng và quy trình.
Hệ thống H3 được ghi lại tách biệt việc diễn giải ngữ cảnh chuyên sâu, tạo âm thanh-video nền và tái tạo độ phân giải cao, đồng thời giữ ngữ cảnh sáng tạo ban đầu xuyên suốt quy trình.

Ngôn ngữ trở thành cầu nối giữa lời nhắc và nhiều loại nội dung, mô tả mối quan hệ giữa chủ thể, cảnh quay, chuyển động, âm thanh và đầu ra đích.
Một hệ thống tiền xử lý được lưu trữ diễn giải hướng dẫn đa phương thức dạng tự do và chuyển đổi chúng thành biểu diễn có cấu trúc để tạo nội dung.
Mô hình nền mở cùng dự đoán các biến tiềm ẩn hình ảnh và âm thanh qua H3-Omni Transformer đa dụng, rồi tạo đầu ra âm thanh-video 768p.
Mô-đun cuối tái sử dụng cả kết quả nền và ngữ cảnh ban đầu để tái tạo chi tiết độ phân giải cao hơn, thay vì chỉ áp dụng siêu phân giải thông thường.
Dùng một quy trình đa phương thức duy nhất để khám phá ý tưởng thương mại, cảnh kể chuyện, thiết kế thương hiệu, tham chiếu chuyển động và ý tưởng nghe nhìn đồng bộ.
Tạo mẫu quảng cáo sản phẩm, ý tưởng chiến dịch, hình ảnh ra mắt, ảnh chụp sản phẩm và quảng cáo mạng xã hội với khả năng tuân thủ hướng dẫn và hiển thị văn bản tốt hơn.
Biến mô tả cảnh, hình ảnh nhân vật, tham chiếu chuyển động và chỉ dẫn âm thanh thành bản dựng điện ảnh ngắn trước khi sản xuất.
Khám phá bộ nhận diện chuyển động, ý tưởng trang web sản phẩm, đoạn tiêu đề, áp phích động và hệ thống hình ảnh thương hiệu.
Chuyển động tác, giữ nguyên chủ thể, tham chiếu phong cách hình ảnh hoặc dùng ngữ cảnh âm thanh và video để mô tả phép biến đổi có mục tiêu.
Phát triển khoảnh khắc nhân vật, đoạn mở đầu trò chơi, phim 3D ngắn cách điệu, áp phích động và thử nghiệm hình ảnh theo nhiều định hướng nghệ thuật.
Thử nghiệm ý tưởng nghe nhìn ngắn với khả năng hỗ trợ hội thoại ổn định đã được ghi nhận cho 11 ngôn ngữ và các ngôn ngữ khác ở nhiều mức chất lượng.
Bắt đầu với bản demo nhúng, nêu rõ mối quan hệ sáng tạo giữa từng nội dung tham chiếu và xem lại kết quả nghe nhìn hoàn chỉnh.
Mở Space được nhúng và chọn quy trình văn bản, khung hình đầu/cuối hoặc tham chiếu đa phương thức hiện có.
Viết lời nhắc chính xác và thêm nội dung tham chiếu được hỗ trợ. Giải thích hình ảnh, video, giọng nói, chuyển động, âm thanh hoặc phong cách nào cần tác động đến kết quả đích.
Gửi tác vụ, chờ hàng đợi được lưu trữ, rồi kiểm tra chuyển động, danh tính, văn bản, lời thoại, hiệu ứng âm thanh, nhạc và mức độ tuân thủ hướng dẫn tổng thể.
Kho chính thức cung cấp các checkpoint FL2VA và Ref2VA cùng công thức cho SGLang, vLLM, diffusers và ComfyUI. Hãy bắt đầu với quy trình H3-Base 768p cục bộ, rồi chỉ mở rộng sau khi xác thực phần cứng và trường hợp sử dụng.
hf download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" \
--local-dir MiniMax-H3
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 --ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 --port 30010 \
--model-variant fl2va
Đọc Community License, hướng dẫn kho mã, kích thước checkpoint và yêu cầu GPU riêng cho từng framework trước khi tải trọng số mô hình.
Dùng FL2VA để tạo từ văn bản và khung hình đầu/cuối, hoặc Ref2VA khi quy trình cần kết hợp tham chiếu hình ảnh, video và âm thanh.
Giới hạn nội dung tải xuống từ Hugging Face ở một dòng tác vụ, hoặc để diffusers lấy các thành phần cần thiết nhằm giảm dung lượng lưu trữ và thời gian thiết lập.
Khởi chạy framework đã chọn, tái tạo một trường hợp chính thức, so sánh đầu ra nghe nhìn rồi quyết định có tích hợp quy trình 2K được lưu trữ hay không.
Quan trọng: trọng số mở không khiến chi phí tính toán GPU trở nên miễn phí. Hãy đọc MiniMax H3 Community License trước khi triển khai. Bản phát hành mở hiện tại gồm H3-Base, trong khi H3-Context-IR và H3-Regenerate-2K là các thành phần được lưu trữ dùng trong quy trình 2K chính thức đầy đủ.
Sau khi tạo một đoạn H3, hãy tăng độ phân giải làm việc cục bộ, sửa hướng hoặc cắt một đoạn nổi bật ngắn hơn bằng các công cụ còn lại trong bộ công cụ.
Tạo
Dùng thử bản demo H3 đa phương thức được lưu trữ, xem các ví dụ chính thức và làm theo lộ trình triển khai H3-Base mở.
Mở công cụ miễn phíTăng cường
Tăng độ phân giải video lên 2× hoặc 4× bằng xử lý cục bộ riêng tư và tùy chọn tăng cường mạng nơ-ron WebGPU.
Mở công cụ miễn phíGương
Lật video theo chiều ngang, chiều dọc hoặc cả hai cách với bản xem trước riêng tư và xuất trình duyệt cục bộ.
Mở công cụ miễn phíCắt
Chọn thời gian bắt đầu và kết thúc chính xác, xem trước nguồn và xuất clip tập trung mà không cần tải lên.
Mở công cụ miễn phíTiếp tục với các nguồn chính thống về lần ra mắt, cách triển khai mở, checkpoint, quy trình và giấy phép mô hình.
Đọc phần giải thích của MiniMax về ngữ cảnh đa phương thức, âm thanh nổi nguyên bản, H3-VAE, Omni Transformer và tái tạo 2K trong ngữ cảnh.
Mở nguồnNguồn chính thứcXem cấu trúc checkpoint, chế độ đầu vào được hỗ trợ, lệnh triển khai, trường hợp có thể tái tạo, kỹ năng viết lời nhắc và phạm vi mã nguồn mở hiện tại.
Mở nguồnNguồn chính thứcKiểm tra bản phát hành chính thức trên Hugging Face, tệp mô hình, Community License và hướng dẫn tải riêng cho từng framework trước khi triển khai.
Mở nguồn