دو رایجترین منبع داده
فایلهای CSV و اکسل رایجترین منبع داده در اکثر پروژههای تحلیلی هستند. KNIME برای هرکدام node اختصاصی
دارد: CSV Reader برای فایلهای متنی جداشونده با کاما یا هر کاراکتر دیگر، و
Excel Reader برای فایلهای .xlsx که میتوانند چند شیت (sheet) داشته باشند.
در تنظیمات Excel Reader، نکات مهمی وجود دارد:
- باید مشخص کنید کدام شیت (یا کدام شیتها) خوانده شود؛ گزینهای برای انتخاب با نام یا با شماره وجود دارد.
- میتوانید محدوده دقیق سلولها (مثلاً از A1 تا F200) را مشخص کنید تا سطرها یا ستونهای اضافی خوانده نشوند.
- اگر چند شیت همزمان انتخاب شوند، خروجی node به تعداد شیتها پورت جداگانه خواهد داشت.
برای CSV Reader، نکته مهم انتخاب صحیح جداکننده است؛ در فایلهای فارسی که از اکسل خروجی گرفته شدهاند، گاهی جداکننده کاما (,) و گاهی سمیکالن (;) است، بهخصوص اگر تنظیمات منطقهای سیستم روی فارسی یا اروپایی باشد. اگر جداکننده اشتباه انتخاب شود، کل فایل در یک ستون واحد خوانده میشود که علامت واضحی از این اشتباه است.
یک نکته کاربردی دیگر: هر دو node گزینه «Skip first rows» دارند که برای فایلهایی که چند خط توضیحی قبل از عنوان ستونها دارند، بسیار مفید است. همیشه پس از اتصال منبع داده، خروجی را با یک Table View سریع بررسی کنید تا مطمئن شوید تعداد سطر و نوع ستونها همان چیزی است که انتظار داشتید.