چرا Pandas؟
Pandas کتابخانهای در پایتون است که کار با دادههای جدولی را ساده میکند. ساختار اصلی آن DataFrame نام دارد و دقیقاً معادل همان صفحه دادهای است که در SPSS یا Excel میبینید: سطرها مشاهدات و ستونها متغیرها.
مزیت اصلی Pandas نسبت به کار با منو این است که هر کاری که انجام میدهید کد میشود. یعنی شش ماه بعد دقیقاً میدانید چه کردهاید، و اگر دادهها بهروزرسانی شوند کافی است همان اسکریپت را دوباره اجرا کنید.
خواندن داده
Pandas تقریباً همه فرمتهای رایج را میخواند، از جمله فایل خروجی SPSS:
برای فایلهای فارسی که با Excel ساخته شدهاند، اگر متنها بههمریخته دیده شدند پارامتر encoding را روی 'utf-8-sig' بگذارید.
شناخت اولیه داده
پیش از هر تحلیلی باید بدانید با چه چیزی سروکار دارید:
دستور describe() همان چیزی را میدهد که در SPSS از مسیر
Descriptives میگرفتید: تعداد، میانگین، انحراف استاندارد، کمینه، بیشینه و چارکها.
پاکسازی داده
دادههای گمشده
جایگزینی با میانگین سادهترین روش است اما واریانس داده را کاهش میدهد. اگر درصد داده گمشده بالاست، روشهای جایگزینی چندگانه انتخاب بهتری هستند و باید در بخش روش پژوهش توضیح داده شوند.
تغییر نام و نوع ستونها
بازکدگذاری گویههای معکوس
معادل Recode در SPSS، برای طیف لیکرت پنجگزینهای:
ساخت نمره سازه
میانگین چند گویه که یک سازه را میسنجند:
گروهبندی و جدول توصیفی
معادل Split File یا Compare Means در SPSS:
برای فیلتر کردن دادهها هم به همین سادگی عمل میکنید:
اجرای آزمون آماری
Pandas خودش آزمون آماری اجرا نمیکند، اما بهراحتی با SciPy ترکیب میشود:
خروجی گرفتن
جدول حاصل مستقیماً قابل استفاده در فصل چهارم پایاننامه یا بخش نتایج مقاله است.
جمعبندی
- DataFrame در Pandas معادل صفحه داده SPSS است.
- با read_spss میتوانید فایلهای sav. را مستقیم بخوانید.
- describe و value_counts سریعترین راه شناخت دادهاند.
- groupby معادل Compare Means است و جدولهای توصیفی میسازد.
- برای آزمونهای آماری، Pandas را با SciPy ترکیب کنید.