خواندن داده از منابع مختلف

خواندن فایل‌های CSV و Excel

دو رایج‌ترین منبع داده

فایل‌های CSV و اکسل رایج‌ترین منبع داده در اکثر پروژه‌های تحلیلی هستند. KNIME برای هرکدام node اختصاصی دارد: CSV Reader برای فایل‌های متنی جداشونده با کاما یا هر کاراکتر دیگر، و Excel Reader برای فایل‌های .xlsx که می‌توانند چند شیت (sheet) داشته باشند.

در تنظیمات Excel Reader، نکات مهمی وجود دارد:

  • باید مشخص کنید کدام شیت (یا کدام شیت‌ها) خوانده شود؛ گزینه‌ای برای انتخاب با نام یا با شماره وجود دارد.
  • می‌توانید محدوده دقیق سلول‌ها (مثلاً از A1 تا F200) را مشخص کنید تا سطرها یا ستون‌های اضافی خوانده نشوند.
  • اگر چند شیت هم‌زمان انتخاب شوند، خروجی node به تعداد شیت‌ها پورت جداگانه خواهد داشت.

برای CSV Reader، نکته مهم انتخاب صحیح جداکننده است؛ در فایل‌های فارسی که از اکسل خروجی گرفته شده‌اند، گاهی جداکننده کاما (,) و گاهی سمی‌کالن (;) است، به‌خصوص اگر تنظیمات منطقه‌ای سیستم روی فارسی یا اروپایی باشد. اگر جداکننده اشتباه انتخاب شود، کل فایل در یک ستون واحد خوانده می‌شود که علامت واضحی از این اشتباه است.

یک نکته کاربردی دیگر: هر دو node گزینه «Skip first rows» دارند که برای فایل‌هایی که چند خط توضیحی قبل از عنوان ستون‌ها دارند، بسیار مفید است. همیشه پس از اتصال منبع داده، خروجی را با یک Table View سریع بررسی کنید تا مطمئن شوید تعداد سطر و نوع ستون‌ها همان چیزی است که انتظار داشتید.

برای ذخیره‌ی پیشرفت و شرکت در آزمون، وارد شوید — رایگان است.