Hình ảnh có cấu trúc. Các pixel lân cận có mối liên hệ với nhau, và các mẫu lặp lại trên toàn khung hình. Mạng tích chập khai thác điều này bằng cách trượt các bộ lọc nhỏ trên ảnh đầu vào, chia sẻ trọng số và phát hiện các đặc điểm cục bộ bất cứ khi nào chúng xuất hiện.
Một kiến trúc điển hình bao gồm các lớp tích chập, hàm kích hoạt và lớp gộp. Các lớp đầu tiên phát hiện các cạnh và kết cấu. Các lớp sâu hơn kết hợp chúng thành các bộ phận và đối tượng. Bộ phân loại cuối cùng ánh xạ các đặc trưng đã học được thành nhãn.
Các khối cấu tạo chính
- Bộ lọc tích chập với trọng số có thể học được
- Gộp các phần tử để giảm kích thước không gian.
- Bước nhảy và khoảng đệm để kiểm soát kích thước đầu ra
- Các lớp kết nối đầy đủ để phân loại
Mạng nơ-ron tích chập (CNN) đã thống trị lĩnh vực xử lý hình ảnh trong một thập kỷ, bắt đầu với AlexNet vào năm 2012. Hiện nay, các mô hình xử lý hình ảnh dựa trên công nghệ chuyển đổi (vision transformer) đang cạnh tranh trên nhiều tiêu chuẩn, nhưng CNN vẫn hiệu quả và được triển khai rộng rãi trong các hệ thống nhúng và di động.
Comments
No comments yet. Be the first to share a thought.
Leave a comment