Tính nhất quán (Consistency) của dữ liệu có nghĩa là gì?
A. Dữ liệu không chứa giá trị trùng lặp
B. Dữ liệu không có mâu thuẫn giữa các nguồn
C. Dữ liệu có tính bảo mật cao
D. Dữ liệu luôn được cập nhật
Khi xử lý dữ liệu thiếu của một cột chứa dữ liệu danh mục (categorical), phương pháp nào hợp lý?
A. Loại bỏ tất cả dữ liệu
B. Điền bằng giá trị trung bình
C. Điền bằng số 0
D. Điền bằng giá trị phổ biến nhất
Khi nào nên sử dụng rời rạc hóa dữ liệu (Discretization)?
A. Khi muốn giảm kích thước dữ liệu bằng PCA
B. Khi muốn chuyển đổi dữ liệu liên tục thành các nhóm giá trị rời rạc
C. Khi muốn chuẩn hóa dữ liệu về cùng một tỷ lệ
D. Khi muốn lọc bỏ dữ liệu nhiễu khỏi tập dữ liệu
Khi dữ liệu có quá nhiều thuộc tính không liên quan, phương pháp nào phù hợp để xử lý?
A. Giữ nguyên tất cả thuộc tính để đảm bảo không mất thông tin
B. Chuyển đổi dữ liệu về dạng văn bản để dễ xử lý hơn
C. Sử dụng PCA hoặc lựa chọn đặc trưng
D. Thêm nhiều thuộc tính mới để tăng tính đa dạng
Một trong những yếu tố chất lượng dữ liệu là gì?
A. Dung lượng dữ liệu
B. Tốc độ xử lý
C. Hệ điều hành sử dụng
D. Tính chính xác
Khi nào nên sử dụng phương pháp giảm số lượng dữ liệu (Numerosity Reduction)?
A. Khi muốn thay thế dữ liệu ban đầu bằng một dạng biểu diễn nhỏ hơn
B. Khi muốn giữ nguyên dữ liệu nhưng thay đổi cách tổ chức
C. Khi muốn tăng độ chính xác của dữ liệu bằng cách làm sạch nó
D. Khi muốn tạo thêm dữ liệu từ dữ liệu gốc
Một trong những nguyên nhân gây dư thừa thuộc tính trong dữ liệu là gì?
A. Khi dữ liệu chứa nhiều bản ghi lỗi
B. Khi dữ liệu bị thiếu thông tin quan trọng
C. Khi cùng một thông tin được lưu trữ dưới nhiều dạng khác nhau
D. Khi dữ liệu không được chuẩn hóa đúng cách
Dữ liệu dư thừa trong quá trình tích hợp có thể gây ra điều gì?
A. Không ảnh hưởng đến dữ liệu
B. Làm tăng tốc độ phân tích dữ liệu
C. Lãng phí tài nguyên lưu trữ và xử lý
D. Giúp mô hình học nhanh hơn
Mối liên hệ giữa toán học và DMML (Khai phá dữ liệu và Máy học) là gì?
A. Đại số tuyến tính giúp biểu diễn dữ liệu dưới dạng ma trận
B. Tất cả các đáp án đều đúng
C. Xác suất thống kê giúp phân tích dữ liệu không chắc chắn
D. Giải tích hỗ trợ xử lý dữ liệu phi tuyến tính
Có những thách thức nào với khai phá dữ liệu?
A. Thay đổi cấu trúc dữ liệu liên tục
B. Giảm chiều của dữ liệu để tăng tốc độ xử lý
C. Tất cả các đáp án đều đúng
D. Xử lý nhiễu trong dữ liệu
Học không giám sát khác học có giám sát ở điểm nào?
A. Học có giám sát không dự đoán được kết quả
B. Học không giám sát không cần dữ liệu nhãn
C. Học không giám sát sử dụng cây quyết định
D. Học không giám sát sử dụng dữ liệu có nhãn
Khai phá dữ liệu (Data Mining) là gì?
A. Sử dụng các công cụ trực quan hóa để trình bày dữ liệu
B. Tìm kiếm dữ liệu trên internet
C. Tạo báo cáo từ dữ liệu đã phân tích
D. Phát hiện thông tin hữu ích từ dữ liệu lớn
Thuật toán hồi quy trong học máy thường được sử dụng để làm gì?
A. Nhóm các phần tử giống nhau
B. Phân loại dữ liệu
C. Dự đoán giá trị liên tục
D. Giảm chiều dữ liệu
Tại sao Python là lựa chọn phổ biến trong DMML?
A. Vì chỉ hoạt động trên một hệ điều hành cụ thể
B. Vì nó là ngôn ngữ lập trình thương mại
C. Vì cú pháp phức tạp phù hợp với chuyên gia
D. Vì có nhiều thư viện hỗ trợ cho khai phá dữ liệu và máy học
Khi xây dựng mô hình máy học, bước tiền xử lý dữ liệu đóng vai trò gì?
A. Là bước cuối cùng để kiểm tra mô hình
B. Là bước phân phối mô hình đã xây dựng
C. Là bước loại bỏ nhiễu và chuẩn hóa dữ liệu
D. Là bước để xây dựng thuật toán học sâu
Trong Weka, chức năng nào được sử dụng để thực hiện phân cụm dữ liệu?
A. Associate
B. Cluster
C. Classify
D. Preprocess
Điểm khác biệt chính giữa học sâu (Deep Learning) và học máy truyền thống là gì?
A. Học sâu không sử dụng mạng nơ-ron nhân tạo
B. Học sâu tự động học đặc trưng từ dữ liệu
C. Học sâu chỉ sử dụng các thuật toán tuyến tính
D. Học sâu không cần dữ liệu để huấn luyện
Kỹ thuật nào sau đây không thuộc về khai phá dữ liệu?
A. Phân cụm
B. Tạo đồ thị
C. Luật kết hợp
D. Phân lớp
Nếu một dữ liệu bị nhập sai do lỗi đánh máy, phương pháp nào phù hợp để sửa lỗi?
A. Dùng kỹ thuật khớp chuỗi
B. Điền dữ liệu thiếu
C. Loại bỏ bản ghi
D. Giữ nguyên dữ liệu
Tại sao tiền xử lý dữ liệu quan trọng đối với Machine Learning?
A. Giúp giảm thời gian xử lý của máy tính
B. Không có tác dụng gì
C. Làm tăng kích thước dữ liệu
D. Giúp mô hình học chính xác hơn