Bỏ qua đến nội dung
Vincent Bui
Tất cả case study

Nghiên cứu cá nhân

Video pipeline

Một pipeline bảy bước chạy ba lần trên các bản nghiên cứu cá nhân và ghi lại đến từng lần render.

Trạng thái
Ba bản nghiên cứu cá nhân năm 2026, không có giá trị thương mại.

Vấn đề

AI video lỗi theo những cách cụ thể và lặp lại: sai ngôn ngữ khi nói, chữ trên màn hình tự bịa, sản phẩm biến thành vật khác và âm thanh chồng nhau.

Cách vận hành

  1. 1Ý tưởng

    Một ý tưởng một dòng kèm tông và thế giới: năng lượng claymation, Sài Gòn thập niên 1960, một câu chơi chữ trồng lúa với trồng răng.

  2. 2Kịch bản

    Một script enhancer mở rộng ý tưởng thành bảy panel có thời lượng cùng gợi ý lời thoại và âm thanh, rồi một hai vòng chỉnh tagline và câu thoại.

    Công cụ hoặc model: tv-ad-script enhancer

  3. 3Nhân vật

    Nhân vật chính được tạo hoặc dựng từ ảnh tham chiếu, tối đa ba vòng, đến khi diện mạo ổn định.

    Công cụ hoặc model: Recraft V4.1, GPT Image 2, Soul 2.0

    Bài học: Soul 2.0 không nhận đồng thời prompt và ảnh tham chiếu, nên dùng GPT Image 2 khi cần ảnh mẫu.

  4. 4Bối cảnh

    Bối cảnh được tạo thành ảnh tĩnh trước: sảnh văn phòng thu nhỏ, giao lộ Sài Gòn 1960, căn bếp retro.

    Công cụ hoặc model: Recraft V4.1, GPT Image 2

  5. 5Video

    Bốn lần render cho mỗi phim. Mỗi lần sửa điều lần trước làm hỏng: bao bì sai, chữ trên màn hình tự bịa, âm thanh chồng nhau, lỗi vật lý khi đánh răng.

    Công cụ hoặc model: Seedance 2.0

    Bài học: Ảnh tham chiếu sản phẩm bị hiểu thành vật khác, gói mì thành túi xách. Prompt phải nêu chính xác thứ được phép và không được phép.

  6. 6Âm thanh

    Lời đọc, nhạc và foley được làm riêng rồi chồng lớp, để sửa từng lớp mà không phải làm lại phần còn lại.

    Công cụ hoặc model: Seed Audio, Sonilo Music, Mirelo TTA, sync_so

    Bài học: Âm thanh gốc của Seedance xử lý tiếng Việt kém. Giọng đọc được tạo riêng và đặt chồng lên âm thanh gốc của video, không thay thế nhịp của nó.

  7. 7Ghép hoàn chỉnh

    Các lớp được mix theo timestamp chính xác: giọng đọc, nhạc và từng tiếng foley đặt theo độ trễ, âm thanh gốc hạ thấp.

    Công cụ hoặc model: ffmpeg, CapCut

Hiện đã có

  • Cùng bảy bước được chạy trên Cao Sao Vàng, Miliket và Hynos Phosphaté.
  • Mỗi phim được render bốn lần (V1 đến V4), ghi lại kiểu lỗi và cách sửa.
  • Giọng đọc, nhạc và foley được làm thành các lớp riêng và mix theo timestamp chính xác.
Video pipeline 1Video pipeline 2Video pipeline 3

Các thương hiệu thuộc về chủ sở hữu, không có tài trợ hay bảo chứng. Ca khúc "Sài Gòn Đẹp Lắm" thuộc về chủ sở hữu bản quyền.

Case tiếp theoAgentic AI

Liên hệ

Chọn cách nào tiện nhất với bạn.