Dự án
Training-Multimodal-Emotion-Analysis — Nghiên Cứu Nhận Diện Cảm Xúc Đa Phương Thức
Dự án nghiên cứu và huấn luyện mô hình nhận diện cảm xúc đa phương thức từ Video, Audio và Văn bản. Triển khai và so sánh hiệu năng các kiến trúc MulT (Multimodal Transformer) và LSTM cải tiến trên tập dữ liệu chuẩn CMU-MOSEI.
Nghiên cứu & R&DTối ưu hóa với AI DevTools
PythonPyTorchMulT (Transformer)LSTMOpenCVCMU-MOSEI

1. Tổng quan Dự án (Project Overview)
Dự án nghiên cứu và huấn luyện mô hình Trí tuệ Nhân tạo chuyên sâu về Nhận diện Cảm xúc Đa phương thức (Multimodal Emotion Analysis), kết hợp đồng thời 3 luồng thông tin: Thị giác (Video), Âm thanh (Audio) và Ngôn ngữ (Text).
2. Kiến trúc Mô hình & Kết quả Thực nghiệm (Model Architectures & Experiments)
- Kiến trúc MulT (Multimodal Transformer): Ứng dụng cơ chế Crossmodal Attention để các phương thức tự trao đổi và củng cố đặc trưng cho nhau mà không làm mất thông tin liên kết theo thời gian.
- Mô hình LSTM Cải tiến: Triển khai kiến trúc Bi-directional LSTM đa tầng kết hợp tầng Attention tập trung vào các đoạn cao trào cảm xúc.
- Thực nghiệm trên CMU-MOSEI: Huấn luyện và đánh giá trên tập dữ liệu chuẩn quốc tế CMU-MOSEI với hơn 23.000 câu thoại video, đạt độ chính xác cạnh tranh và xuất sắc ở các lớp cảm xúc phức tạp.