پاک‌سازی داده

فیلتر کردن سطر و ستون

نگه داشتن فقط آنچه نیاز است

در بیشتر پروژه‌ها، همه ستون‌ها یا همه سطرهای یک منبع داده مورد نیاز نیستند. KNIME دو node جداگانه برای این منظور دارد: Column Filter برای انتخاب یا حذف ستون‌ها، و Row Filter برای نگه داشتن یا حذف سطرها بر اساس یک شرط.

در Column Filter، دو لیست «Include» و «Exclude» می‌بینید که با دکمه‌های فلش می‌توانید ستون‌ها را بین آن‌ها جابه‌جا کنید؛ فقط ستون‌های موجود در «Include» به خروجی می‌روند. این node برای حذف ستون‌های شناسه داخلی یا ستون‌هایی که در تحلیل نهایی استفاده نمی‌شوند بسیار مفید است.

Row Filter بر اساس شرط روی مقدار یک یا چند ستون عمل می‌کند:

مثال شرط‌های رایج در Row Filter:
- نگه داشتن سطرهایی که ستون "شهر" برابر "تهران" است
- حذف سطرهایی که ستون "مبلغ" کمتر از صفر است (داده خراب)
- نگه داشتن سطرهایی که ستون "تاریخ" بعد از یک تاریخ مشخص است

یک node مرتبط و قدرتمندتر به نام Rule-based Row Filter امکان نوشتن شرط‌های ترکیبی پیچیده‌تر را می‌دهد، مثلاً ترکیب چند شرط با AND و OR در یک قانون:

$شهر$ = "تهران" AND $مبلغ$ > 100000 => TRUE

توصیه عملی این است که فیلترها را همیشه زودتر در جریان workflow اعمال کنید تا node‌های بعدی روی حجم داده کوچک‌تری کار کنند؛ این باعث می‌شود کل workflow سریع‌تر اجرا شود، به‌خصوص وقتی با فایل‌های چند صدهزار سطری کار می‌کنید.

برای ذخیره‌ی پیشرفت و شرکت در آزمون، وارد شوید — رایگان است.