پاکسازی و تبدیل ستونهای متنی
دادههای متنی واقعی بهندرت تمیز هستند: فاصلههای اضافه، حروف بزرگ و کوچک نامنظم، یا نیاز به استخراج بخشی از یک رشته. node String Manipulation ابزار اصلی KNIME برای این نوع کارهاست و از یک مجموعه غنی از توابع رشتهای پشتیبانی میکند.
توابع پرکاربرد String Manipulation:
trim($نام$) › حذف فاصلههای ابتدا و انتها
lowerCase($ایمیل$) › تبدیل به حروف کوچک
upperCase($کد_پیگیری$) › تبدیل به حروف بزرگ
substr($کد_ملی$, 0, 4) › استخراج چهار کاراکتر ابتدایی
replace($شماره$, "-", "") › حذف خطتیره از یک رشته
join($نام$, " ", $نام_خانوادگی$) › ترکیب دو ستون با یک فاصله
یک الگوی بسیار رایج، پاکسازی ستون ایمیل پیش از هرگونه تحلیل یا join است: حذف فاصلههای اضافی با
trim و یکسانسازی حروف با lowerCase، چون دو مقدار مثل
Ali@Example.com و ali@example.com از نظر انسانی یکساناند اما برای کامپیوتر دو
رشته کاملاً متفاوت محسوب میشوند و باعث شکست join یا گروهبندی نادرست میشوند.
برای الگوهای پیچیدهتر متنی (مثل استخراج کد پستی از یک آدرس کامل)، node مرتبط String Manipulation (Regex) یا ترکیب با Regex Split در دسترس است که از عبارتهای باقاعده (regular expression) پشتیبانی میکند. توصیه میشود ابتدا با توابع ساده String Manipulation شروع کنید و فقط در صورت نیاز واقعی سراغ regex بروید، چون خوانایی workflow را برای دیگران بیشتر حفظ میکند.