قبل از هر تحلیلی، داده را بشناسید
پیش از شروع هر پاکسازی یا تحلیلی، باید یک نگاه اولیه به کیفیت و ساختار داده بیندازید. KNIME چند node آماده برای این کار دارد که وقت زیادی صرفهجویی میکنند.
node «Statistics» یک جدول آماری کامل تولید میکند که شامل میانگین، میانه، انحراف معیار، حداقل، حداکثر و تعداد مقادیر گمشده (missing) برای هر ستون عددی است. برای ستونهای متنی، فراوانی مقادیر مختلف را نشان میدهد. این خروجی معمولاً اولین جایی است که مشکلاتی مثل مقادیر پرت (outlier) یا حجم بالای داده گمشده در یک ستون خاص، خودشان را نشان میدهند.
node دیگر به نام «Data Explorer» نمایش بصریتری از توزیع داده هر ستون ارائه میدهد. همچنین با کلیک روی عنوان هر ستون در یک Table View، میتوانید بهسرعت نوع داده (String، Int، Double، Date&Time) را ببینید که برای تصمیمگیری درباره nodeهای تبدیل بعدی ضروری است.
یک عادت خوب این است که همیشه پس از اتصال به هر منبع داده جدید، این سه سؤال را از خودتان بپرسید: چند سطر و چند ستون دارم؟ کدام ستونها مقدار گمشده دارند و چقدر؟ آیا نوع داده هر ستون با انتظارم مطابقت دارد (مثلاً ستون تاریخ واقعاً بهصورت Date خوانده شده، نه رشته متنی)؟ پاسخ به این سه سؤال، نقشه راه پاکسازی داده در فصل بعدی را مشخص میکند.