Cho bảng dữ liệu n mẫu, m thuộc tính rời rạc, cột cuối là nhãn lớp. Hãy chọn thuộc tính cho Information Gain lớn nhất để chia nút gốc.
IGj=H(y)−∑vn∣Sv∣H(Sv)
Nếu nhiều thuộc tính có cùng IG lớn nhất, chọn thuộc tính có chỉ số nhỏ hơn (đánh số từ 0). In chỉ số thuộc tính và giá trị IG tương ứng.
Dòng đầu: n m. n dòng tiếp theo, mỗi dòng m+1 số nguyên: m thuộc tính rồi nhãn.
1≤n≤500; 1≤m≤20; giá trị không âm.
Một dòng: chỉ số thuộc tính tốt nhất (số nguyên) và IG (2 chữ số thập phân), cách nhau dấu cách.
Ví dụ:
Đầu vào:
4 2
0 1 0
0 1 0
1 0 1
1 0 1
Đầu ra:
0 1.00
Giải thích:
Đang tải editor...