خواندن داده از منابع مختلف

بررسی اولیه و آمار توصیفی داده خوانده‌شده

قبل از هر تحلیلی، داده را بشناسید

پیش از شروع هر پاک‌سازی یا تحلیلی، باید یک نگاه اولیه به کیفیت و ساختار داده بیندازید. KNIME چند node آماده برای این کار دارد که وقت زیادی صرفه‌جویی می‌کنند.

node «Statistics» یک جدول آماری کامل تولید می‌کند که شامل میانگین، میانه، انحراف معیار، حداقل، حداکثر و تعداد مقادیر گم‌شده (missing) برای هر ستون عددی است. برای ستون‌های متنی، فراوانی مقادیر مختلف را نشان می‌دهد. این خروجی معمولاً اولین جایی است که مشکلاتی مثل مقادیر پرت (outlier) یا حجم بالای داده گم‌شده در یک ستون خاص، خودشان را نشان می‌دهند.

node دیگر به نام «Data Explorer» نمایش بصری‌تری از توزیع داده هر ستون ارائه می‌دهد. همچنین با کلیک روی عنوان هر ستون در یک Table View، می‌توانید به‌سرعت نوع داده (String، Int، Double، Date&Time) را ببینید که برای تصمیم‌گیری درباره node‌های تبدیل بعدی ضروری است.

یک عادت خوب این است که همیشه پس از اتصال به هر منبع داده جدید، این سه سؤال را از خودتان بپرسید: چند سطر و چند ستون دارم؟ کدام ستون‌ها مقدار گم‌شده دارند و چقدر؟ آیا نوع داده هر ستون با انتظارم مطابقت دارد (مثلاً ستون تاریخ واقعاً به‌صورت Date خوانده شده، نه رشته متنی)؟ پاسخ به این سه سؤال، نقشه راه پاک‌سازی داده در فصل بعدی را مشخص می‌کند.

برای ذخیره‌ی پیشرفت و شرکت در آزمون، وارد شوید — رایگان است.