Hướng dẫn tạo và train model trên Applio

Quy trình từng bước cho máy Windows chạy CPU, dùng bộ audio mới sạch và êm hơn bộ cũ.

Đường đi nhanh

Tạo dataset → Refresh → chọn QN_New → Preprocess → Extract Features → cài Training → Advanced Settings → Start Training → test epoch 5/10/15.

Nguyên tắc: làm từng bước, thấy bước hiện tại thành công rồi mới chuyển sang bước sau. Không xóa model cũ Quoc_Nguyen.

BƯỚC 1

Tạo model mới

Trong tab Training, tìm ô Model Name và nhập QN_New. Giữ Sampling Rate 40000, Vocoder HiFi-GAN, CPU Cores 2 và GPU Number -.

Cần nhớ: Chưa bấm Start Training.
BƯỚC 2

Chọn Dataset Path

Ở phần Preprocess, tìm Dataset Path. Bấm Refresh nếu chưa thấy QN_New, sau đó chọn assets\datasets\QN_New.

Cần nhớ: Chưa bấm Preprocess Dataset.
BƯỚC 3

Preprocess Dataset

Kiểm tra Audio cutting = Automatic, Chunk length = 3 giây, Overlap = 0.3 giây, Noise filter tắt, Noise Reduction tắt, Normalization = post. Sau đó bấm Preprocess Dataset.

Cần nhớ: Chỉ sang bước tiếp theo khi hiện: Model QN_New preprocessed successfully.
BƯỚC 4

Extract Features

Trong phần Extract, dùng rmvpe cho Pitch extraction và contentvec cho Embedder Model. Silent training files = 2. Bấm Extract Features.

Cần nhớ: Chỉ sang Training khi hiện: Model QN_New extracted successfully.
BƯỚC 5

Cài thông số Training

Đặt Batch Size = 1, Save Every Epoch = 5 và Total Epoch = 15. Các mốc 5, 10, 15 sẽ giúp bạn test từng model.

Cần nhớ: Chưa bấm Start Training.
BƯỚC 6

Advanced Settings

Đặt Save Only Latest = OFF; Fresh Training = ON; Save Every Weights = ON; Pretrained = ON; Cache Dataset in GPU = OFF; Checkpointing = OFF; Shutdown after finishing = OFF; Custom Pretrained = OFF.

Cần nhớ: Fresh Training chỉ dùng khi tạo model mới QN_New.
BƯỚC 7

Index và bắt đầu train

Index Algorithm = Auto. Tích I agree to the terms of use. Kiểm tra toàn bộ thông số rồi mới bấm Start Training.

Cần nhớ: Sau khi Start, không đóng cửa sổ console/bảng đen trong lúc train.

Chuẩn bị dataset

Tạo thư mục:

C:\Users\DELL\Downloads\ApplioV3.6.4\assets\datasets\QN_New

Đưa audio mới vào đó. File mẫu đã dùng là anh da khong giu.ogg, khoảng 1 phút 16 giây.

Không trộn dataset cũ vào QN_New trong lần thử này nếu mục tiêu là kiểm tra bộ audio mới.

Checklist trước khi Start Training

Mục Giá trị
Model Name QN_New
Dataset Path assets\datasets\QN_New
CPU Cores 2
GPU Number -
Batch Size 1
Save Every Epoch 5
Total Epoch 15
Save Only Latest Tắt
Fresh Training Bật
Save Every Weights Bật
Pretrained Bật
Cache Dataset in GPU Tắt
Checkpointing Tắt
Index Algorithm Auto
I agree to the terms of use Tích
Mục tiêu: ưu tiên giọng êm, rõ lời, tự nhiên và không quá “ồ”/nặng. Epoch cao không mặc định tốt hơn.

Sau khi train xong

Test lần lượt model ở epoch 5 → 10 → 15 bằng cùng một câu/file nguồn.

Chọn bản nghe êm + rõ + tự nhiên + có chất giọng riêng. Với model cũ, trải nghiệm trước đó cho thấy epoch 20 quá trầm; vì vậy QN_New nên được đánh giá riêng.

Nếu có lỗi

Thiếu sliced_audios_16k

Chạy lại Preprocess Dataset thành công rồi mới Extract Features.

WinError 1455

Máy thiếu bộ nhớ ảo. Giữ Batch Size thấp, đóng bớt ứng dụng nặng và kiểm tra Virtual Memory nếu lỗi lặp lại.

Máy mất nguồn

Không train lại từ đầu ngay. Kiểm tra logs\QN_New và xem log Loaded checkpoint ... (epoch X) để biết checkpoint thực tế trước khi resume.

Tài liệu được hoàn thiện từ quy trình thực tế đã thực hiện trong Applio V3.6.4 trên máy Windows chạy CPU. Ảnh minh họa là ảnh chụp màn hình của chính quá trình thao tác và đã được crop để tập trung vào phần cần bấm.