Khi nào nên sử dụng rời rạc hóa dữ liệu (Discretization)?
A. Khi muốn giảm kích thước dữ liệu bằng PCA
B. Khi muốn chuyển đổi dữ liệu liên tục thành các nhóm giá trị rời rạc
C. Khi muốn chuẩn hóa dữ liệu về cùng một tỷ lệ
D. Khi muốn lọc bỏ dữ liệu nhiễu khỏi tập dữ liệu
Khi dữ liệu có quá nhiều thuộc tính không liên quan, phương pháp nào phù hợp để xử lý?
A. Giữ nguyên tất cả thuộc tính để đảm bảo không mất thông tin
B. Chuyển đổi dữ liệu về dạng văn bản để dễ xử lý hơn
C. Sử dụng PCA hoặc lựa chọn đặc trưng
D. Thêm nhiều thuộc tính mới để tăng tính đa dạng
Một trong những yếu tố chất lượng dữ liệu là gì?
A. Dung lượng dữ liệu
B. Tốc độ xử lý
C. Hệ điều hành sử dụng
D. Tính chính xác
Khi nào nên sử dụng phương pháp giảm số lượng dữ liệu (Numerosity Reduction)?
A. Khi muốn thay thế dữ liệu ban đầu bằng một dạng biểu diễn nhỏ hơn
B. Khi muốn giữ nguyên dữ liệu nhưng thay đổi cách tổ chức
C. Khi muốn tăng độ chính xác của dữ liệu bằng cách làm sạch nó
D. Khi muốn tạo thêm dữ liệu từ dữ liệu gốc
Một trong những nguyên nhân gây dư thừa thuộc tính trong dữ liệu là gì?
A. Khi dữ liệu chứa nhiều bản ghi lỗi
B. Khi dữ liệu bị thiếu thông tin quan trọng
C. Khi cùng một thông tin được lưu trữ dưới nhiều dạng khác nhau
D. Khi dữ liệu không được chuẩn hóa đúng cách
Dữ liệu dư thừa trong quá trình tích hợp có thể gây ra điều gì?
A. Không ảnh hưởng đến dữ liệu
B. Làm tăng tốc độ phân tích dữ liệu
C. Lãng phí tài nguyên lưu trữ và xử lý
D. Giúp mô hình học nhanh hơn
Vì sao không nên sử dụng giá trị mặc định như "Unknown" để thay thế dữ liệu thiếu?
A. Vì nó làm giảm tính chính xác
B. Vì nó làm mất dữ liệu
C. Vì nó làm tăng kích thước dữ liệu
D. Vì nó có thể làm sai lệch phân tích dữ liệu
Khi nào nên loại bỏ bản ghi có dữ liệu thiếu?
A. Không bao giờ nên loại bỏ bản ghi
B. Khi bản ghi chứa quá nhiều giá trị bị thiếu
C. Khi dữ liệu có giá trị âm
D. Khi bản ghi chỉ thiếu một giá trị
Vì sao cần chuẩn hóa dữ liệu (Normalization)?
A. Giúp dữ liệu có nhiều giá trị phong phú hơn
B. Giúp tăng tốc độ xử lý dữ liệu
C. Giúp tạo ra dữ liệu mới từ dữ liệu gốc
D. Giúp dữ liệu có cùng đơn vị đo, tránh ảnh hưởng bởi giá trị quá lớn hoặc quá nhỏ
Vì sao tính đầy đủ (Completeness) quan trọng trong dữ liệu?
A. Giảm kích thước tập dữ liệu
B. Giúp dữ liệu không bị thiếu thông tin quan trọng
C. Giúp tăng tốc độ xử lý mô hình
D. Không quan trọng lắm
Nếu dữ liệu không được cập nhật kịp thời, nó có thể gặp vấn đề gì?
A. Không có vấn đề gì
B. Giảm tính chính xác (Accuracy)
C. Giảm tính thời sự (Timeliness)
D. Giảm tính đầy đủ (Completeness)
Làm sạch dữ liệu gồm những bước nào?
A. Xử lý dữ liệu nhiễu
B. Xử lý dữ liệu thiếu
C. Biến đổi dữ liệu và Phân tích tương quan
D. Xử lý dữ liệu thiếu và Xử lý dữ liệu nhiễu
Phương pháp nào giúp điền dữ liệu thiếu bằng giá trị trung bình hoặc trung vị?
A. Sử dụng hằng số chung
B. Sử dụng đại lượng trung tâm
C. Loại bỏ bản ghi
D. Không làm gì
Một cách để giải quyết vấn đề dư thừa thuộc tính là gì?
A. Loại bỏ các thuộc tính có thể suy luận từ các thuộc tính khác
B. Giữ lại tất cả các thuộc tính để có nhiều thông tin hơn
C. Chỉ sử dụng một nguồn dữ liệu duy nhất
D. Bỏ qua bước tích hợp dữ liệu
Tích hợp dữ liệu là gì?
A. Quá trình phân loại dữ liệu theo nhóm
B. Quá trình kết hợp dữ liệu từ nhiều nguồn khác nhau
C. Quá trình giảm kích thước tập dữ liệu
D. Quá trình làm sạch dữ liệu trước khi sử dụng
Làm thế nào để phát hiện dữ liệu trùng lặp trong quá trình tích hợp?
A. Xóa toàn bộ dữ liệu có cùng một ID
B. Chuyển đổi dữ liệu sang định dạng văn bản để so sánh
C. Tăng kích thước tập dữ liệu để kiểm tra trực quan
D. Sử dụng thuật toán so khớp dữ liệu để xác định bản ghi giống nhau
Dữ liệu nhiễu là gì?
A. Dữ liệu dư thừa
B. Dữ liệu bị mất
C. Dữ liệu thiếu đơn vị đo
D. Dữ liệu không phản ánh đúng thực tế
Xung đột dữ liệu trong tích hợp dữ liệu là gì?
A. Khi cùng một thuộc tính có giá trị khác nhau giữa các nguồn dữ liệu
B. Khi dữ liệu không có đủ thuộc tính để sử dụng
C. Khi dữ liệu không được cập nhật kịp thời
D. Khi dữ liệu bị trùng lặp trong cùng một bảng
Việc tạo hệ thống phân cấp khái niệm (Concept Hierarchy) có tác dụng gì?
A. Giúp phát hiện dữ liệu ngoại lai dễ dàng hơn
B. Giúp tổ chức dữ liệu theo các mức độ trừu tượng khác nhau
C. Giúp giảm kích thước tập dữ liệu bằng PCA
D. Giúp mô hình học máy chạy nhanh hơn
Một ví dụ nào sau đây thể hiện dữ liệu có tính khả tín (Believability) cao?
A. Dữ liệu từ một trang web cá nhân
B. Dữ liệu từ mạng xã hội
C. Dữ liệu từ một bài báo không rõ nguồn gốc
D. Dữ liệu được công bố trong tạp chí khoa học uy tín