پاک‌سازی داده

خلاصه‌سازی داده با GroupBy

از جزئیات به خلاصه

node GroupBy یکی از پرکاربردترین node‌های KNIME است و معادل Pivot Table در اکسل یا دستور GROUP BY در SQL عمل می‌کند. با آن می‌توانید سطرهای یک جدول را بر اساس مقدار یک یا چند ستون گروه‌بندی کرده و برای هر گروه یک محاسبه خلاصه (جمع، میانگین، تعداد و غیره) انجام دهید.

تنظیمات GroupBy در دو بخش اصلی است: بخش «Group» که ستون یا ستون‌های گروه‌بندی را مشخص می‌کند، و بخش «Manual Aggregation» که مشخص می‌کند روی کدام ستون‌ها و با چه تابعی خلاصه‌سازی انجام شود.

داده ورودی (سفارش‌ها):
| شهر    | مبلغ   |
|--------|--------|
| تهران  | 150000 |
| تهران  | 200000 |
| مشهد   | 90000  |

تنظیم GroupBy: Group by = شهر، Aggregation = Sum(مبلغ), Count(*)

خروجی:
| شهر    | مجموع مبلغ | تعداد سفارش |
|--------|------------|-------------|
| تهران  | 350000     | 2           |
| مشهد   | 90000      | 1           |

توابع تجمیعی رایج شامل Sum (جمع)، Mean (میانگین)، Count (تعداد)، Minimum و Maximum، و همچنین Concatenate برای ترکیب مقادیر متنی یک گروه در یک رشته واحد هستند. می‌توانید هم‌زمان چند تابع تجمیعی روی چند ستون مختلف اعمال کنید، مثلاً هم‌زمان جمع مبلغ و میانگین تعداد اقلام هر سفارش را در یک node به دست آورید.

یک نکته کاربردی: اگر بخواهید هم داده اصلی و هم نتیجه خلاصه‌شده را کنار هم داشته باشید (نه فقط جدول خلاصه)، باید از node «GroupBy» به همراه یک «Joiner» بعدی استفاده کنید تا نتیجه خلاصه را دوباره به داده اصلی وصل کنید.

برای ذخیره‌ی پیشرفت و شرکت در آزمون، وارد شوید — رایگان است.