Prog Academy
RU UA

Курс за підпискою

Підготовка даних з pandas: від брудного файлу до даних для моделі

Навчіться перетворювати сирі таблиці на дані, на яких модель справді може вчитися

  • 13 модулів
  • 60+ практичних завдань
  • Автоматична перевірка
  • Українською

Отримати доступ до курсу

Курс за підпискою · Навчання у власному темпі

Про курс

Що це за курс?

Реальні дані рідко бувають чистими: зайві пробіли в назвах, ціни на кшталт "$1,299.00", дати в трьох форматах, дублікати клієнтів, пропуски там, де вони найменш доречні. Модель машинного навчання нічого з цим не зробить — їй потрібна акуратна числова таблиця. У цьому курсі ви крок за кроком опануєте pandas — головну бібліотеку Python для роботи з таблицями — і пройдете весь шлях: завантажити, оглянути, очистити, перетворити й віддати моделі масиви X та y.

Аудиторія

Для кого цей курс?

  • Знаєте базовий Python

    Опануєте pandas: читатимете CSV, фільтруватимете через loc, iloc і маски, групуватимете й з'єднуватимете таблиці.

  • Працюєте з «брудними» таблицями

    Чиститимете пропуски, типи, текст, дати й дублікати — аж до підсумкового проєкту з вивантажкою з CRM.

  • Готуєте дані для моделі

    Кодуватимете категорії, масштабуватимете ознаки без витоку даних і віддаватимете моделі масиви X та y.

Спершу потрібна підготовка

Курс спирається на знання, позначені нижче як обов’язкові.

Потрібно знати

  • Базовий Python (змінні, списки, словники, цикли, функції).

    Детальніше
    • Досвід із NumPy корисний, але не обов'язковий, а знати машинне навчання не потрібно зовсім.
    • Встановлювати нічого не треба — pandas і NumPy уже є в середовищі виконання.

Якщо цих знань ще немає — пройдіть курси за порядком:

  1. З нуля
  2. Обов’язково Основи програмування на Python
  3. Цей курс Підготовка даних з pandas: від брудного файлу до даних для моделі

Результат

Що ви навчитеся робити

створювати DataFrame і читати CSV з нестандартними роздільниками, заголовками й позначками пропусків

за хвилину оглядати новий набір даних: типи, пропуски, розподіли, підозрілі значення

вибирати рядки й стовпці через loc, iloc і булеві маски, сортувати за кількома ключами

знаходити, видаляти й заповнювати пропуски — зокрема медіаною групи та попереднім значенням у часовому ряді

виправляти типи, чистити текст через .str, розбирати дати й прибирати дублікати

рахувати нові стовпці без циклів, групувати, будувати зведені таблиці та змінювати форму даних

з'єднувати таблиці через concat і merge та ловити помилки ключів до того, як вони зіпсують результат

кодувати категорії, масштабувати ознаки без витоку даних, ділити вибірку на train і test

конструювати нові ознаки, знаходити викиди й відкидати марні стовпці

Формат

Як влаштоване навчання?

53 практичні завдання з автоматичною перевіркою: ви пишете справжній код pandas у вбудованому редакторі, а програма перевіряє його на прихованих наборах даних — із пропусками, дублікатами, порожніми результатами та іншими крайніми випадками, які трапляються в реальній роботі. Кожен розділ завершує тест на розуміння. Наприкінці — підсумковий проєкт: ви очищаєте «брудну» вивантажку з CRM і перетворюєте її на матрицю ознак для моделі.

  • Теорія

    32 уроки з прикладами

  • Практика в браузері

    60+ завдань з автоматичною перевіркою

  • Тести

    13 тестів для самоперевірки

  • Власний темп

    Онлайн на my.prog.academy, без встановлення програм

AI-помічник

AI-помічник поруч під час навчання

На сторінках курсу, уроків і завдань є кнопка «Запитати AI». Помічник знає матеріали саме цього курсу й урок, на якому ви зараз, тому відповідає по темі й показує, у яких уроках про це йдеться.

  • Пояснить інакше

    Не зрозуміли урок з першого разу — попросіть пояснити простіше або дати ще один приклад.

  • Допоможе із завданням

    Застрягли — підкаже, з чого почати, і допоможе знайти помилку у вашому рішенні. Готового рішення не дає.

  • Знайде потрібну тему

    Запитайте, де пояснювали поняття, — і отримаєте посилання на потрібні уроки курсу.

  • Продовжить розмову

    Уточнюйте без повторів: помічник пам’ятає розмову, а нещодавні розмови курсу зберігаються.

Входить у кожен тариф оплаченої підписки — Basic і Premium. У Premium ліміти використання AI-помічника вищі — ним можна користуватися активніше. Це помічник у навчанні, а не генератор готових відповідей: він пояснює й підказує, а завдання ви розв’язуєте самі.

Програма

Програма курсу

13 модулів, 60+ практичних завдань з автоматичною перевіркою і 13 тестів. Відкрийте модуль, щоб побачити всі теми.

Розділ 1 — DataFrame і завантаження даних 4 уроки · 4 практики · 1 тест

Навіщо готувати дані перед аналізом і шлях даних у курсі; Series і DataFrame, створення таблиць зі словників і записів, read_csv з нестандартними параметрами, вибір і перейменування стовпців

  • Теорія Навіщо чистити дані: від сирої вивантажки до моделі
  • Теорія Навіщо pandas: таблиця як об'єкт Python
  • Практика DataFrame з JSON
  • Теорія read_csv: роздільники, заголовки, пропуски
  • Практика Вивантажка без заголовка
  • Теорія Стовпці: вибір, перейменування, чисті назви
  • Практика Чисті назви стовпців
  • Практика Ознаки й цільова змінна
  • Тест DataFrame і завантаження даних
Розділ 2 — Огляд набору даних 3 уроки · 4 практики · 1 тест

Перший погляд на нові дані: форма, типи, заповненість, описова статистика, розподіли категорій і чек-лист якості

  • Теорія Перший погляд: shape, head, info, dtypes
  • Практика Профіль стовпців
  • Теорія Описова статистика й розподіли
  • Практика Статистика числових стовпців
  • Практика Частки категорій
  • Теорія Чек-лист якості даних
  • Практика Сканер якості даних
  • Тест Огляд набору даних
Розділ 3 — Вибір рядків і фільтрація 3 уроки · 5 практик · 1 тест

loc та iloc, булеві маски з кількома умовами, isin і between, пропуски в порівняннях, сортування за кількома ключами

  • Теорія loc та iloc: мітки й позиції
  • Практика Loc чи iloc — що саме буде вибрано
  • Практика Loc проти iloc
  • Теорія Булеві маски: умови, isin, between, query
  • Практика Фільтр каталогу
  • Практика Які замовлення перевірити
  • Теорія Сортування: кілька ключів, пропуски, найбільші значення
  • Практика Сортування каталогу й топ за рейтингом
  • Тест Вибір і фільтрація
Розділ 4 — Пропущені значення 3 уроки · 7 практик · 1 тест

Як виглядають пропуски в pandas, як їх порахувати, коли видаляти рядки й стовпці, чим і як заповнювати — зокрема за групами й у часових рядах

  • Теорія Пропуски: як виглядають і як їх порахувати
  • Практика Звіт про пропуски
  • Теорія Видалити чи заповнити: dropna і fillna
  • Практика Скільки рядків залишить dropna
  • Практика Правила видалення
  • Практика Заповнення медіаною й модою
  • Теорія Заповнення за групами й у часі
  • Практика Чим заповнити пропуск
  • Практика Медіана відділу
  • Практика Пропуски в показах датчиків
  • Тест Пропущені значення
Розділ 5 — Типи, текст і дублікати 3 уроки · 6 практик · 1 тест

Перетворення типів і to_numeric з errors, nullable-типи й категорії, очищення тексту через.str, регулярні вирази, пошук і видалення дублікатів

  • Теорія Типи даних: to_numeric, astype, nullable-типи, категорії
  • Практика Діагноз типів за info()
  • Практика Ціни з символами
  • Практика Цілі, булеві й категорії
  • Теорія Очищення тексту: аксесор.str і регулярні вирази
  • Практика Одна назва міста
  • Практика Коди з повідомлень
  • Теорія Дублікати: точні й «майже однакові»
  • Практика Клієнти без повторів
  • Тест Типи, текст і дублікати
Розділ 6 — Дати й час 3 уроки · 3 практики · 1 тест

to_datetime з явним форматом і errors='coerce', аксесор.dt, різниця дат у групах, resample і періоди

  • Теорія to_datetime: розбір дат без сюрпризів
  • Практика Розбір дат і дні тижня
  • Теорія Ознаки з дат:.dt, різниці, групи
  • Практика Ознаки з часу замовлення
  • Теорія Групування за часом: resample і періоди
  • Практика Продажі за місяцями
  • Тест Дати й час
Розділ 7 — Перетворення й агрегація 3 уроки · 6 практик · 1 тест

Нові стовпці без циклів: assign, np.where, map, clip; коли apply доречний, а коли ні; groupby з іменованими агрегатами й transform; pivot_table і melt

  • Теорія Нові стовпці без циклів: assign, np.where, map
  • Практика Сума, знижка, купон
  • Практика Вартість доставки
  • Теорія groupby: розділити, застосувати, об'єднати
  • Практика Статистика відділів
  • Практика Частка в сумі клієнта
  • Теорія Зміна форми: pivot_table і melt
  • Практика Зведена таблиця продажів
  • Практика З широкої таблиці в довгу
  • Тест Перетворення й агрегація
Розділ 8 — Об'єднання таблиць 3 уроки · 5 практик · 1 тест

concat для частин однієї таблиці, merge за ключем і чотири типи з'єднань, перевірка ключів через validate і звірка джерел через indicator

  • Теорія concat: зібрати частини в одну таблицю
  • Практика Склеїти вивантажки
  • Теорія merge: з'єднання таблиць за ключем
  • Практика Продажі за країнами
  • Теорія Перевірки під час злиття: validate та indicator
  • Практика Скільки рядків дасть merge
  • Практика Безпечний довідник цін
  • Практика Звірка складу
  • Тест Об'єднання таблиць
Розділ 9 — Кодування й масштабування 2 уроки · 6 практик · 1 тест

Порядкове кодування й one-hot, однакові стовпці для train і test, min-max і стандартизація без витоку даних

  • Теорія Категорії в числа: порядкове кодування й one-hot
  • Практика Як закодувати ознаку
  • Практика Порядкові коди
  • Практика One-hot через get_dummies
  • Практика Однакові стовпці для train і test
  • Теорія Масштабування: min-max, стандартизація й витік даних
  • Практика Min-max масштабування
  • Практика Стандартизація без витоку
  • Тест Кодування й масштабування
Розділ 10 — Від таблиці до моделі 1 урок · 3 практики · 1 тест

Портрет цільової змінної й баланс класів, відтворюваний і стратифікований поділ на train і test, масиви X та y з перевірками

  • Теорія Від таблиці до X і y: баланс класів і поділ на train/test
  • Практика Портрет класів
  • Практика Відтворюваний поділ
  • Практика X і y для моделі
  • Тест Від таблиці до моделі
Розділ 11 — Інженерія ознак 1 урок · 4 практики · 1 тест

Нові ознаки з наявних: відношення й безпечне ділення, умови через np.select, інтервали через pd.cut, ознаки з тексту

  • Теорія Нові ознаки: відношення, умови, інтервали, текст
  • Практика ІМТ і маржа
  • Практика Вікові групи через pd.cut
  • Практика Цінові сегменти через np.select
  • Практика Ознаки з відгуків
  • Тест Інженерія ознак
Розділ 12 — Викиди й відбір ознак 2 уроки · 5 практик · 1 тест

Викиди за правилом IQR, обрізання квантилями, видалення марних ознак і кореляція з цільовою змінною

  • Теорія Викиди: знайти й приборкати
  • Практика Межі IQR і що робити з викидом
  • Практика Викиди за IQR
  • Практика Обрізання квантилями
  • Теорія Відбір ознак: що прибрати, що лишити
  • Практика Прибрати марні ознаки
  • Практика Які ознаки пов'язані з ціллю
  • Тест Викиди й відбір ознак
Розділ 13 — Підсумковий проєкт: від брудного файлу до моделі 1 урок · 3 практики · 1 тест

Увесь конвеєр підготовки даних у двох завданнях: очищення реальної вивантажки з CRM і побудова матриці ознак для моделі

  • Теорія Конвеєр підготовки даних: порядок кроків
  • Практика Порядок кроків конвеєра
  • Практика Проєкт, частина 1: очищення вивантажки з CRM
  • Практика Проєкт, частина 2: матриця ознак для моделі
  • Тест Підсумковий тест курсу

Стек

Які технології використовуються?

  • Python
  • pandas

Код пишете й запускаєте в браузері на платформі — встановлювати нічого не потрібно.

Застосування

Де застосовуються ці знання?

  1. Підготовка датасетів для моделей машинного навчання
  2. Аналітика і звіти на Python
  3. Очищення вивантажень з CRM, магазинів і логів

Доступ

Як отримати доступ?

  1. Залиште заявку

    Заповніть коротку форму на цій сторінці.

  2. Завершіть реєстрацію в Telegram

    Після заявки перейдіть у Telegram-бот Prog Academy — він надішле подальші інструкції щодо доступу.

  3. Навчайтеся на платформі

    Уроки, практика й тести — на my.prog.academy, у зручному для вас темпі.

Контакт

Почніть навчання на платформі

Залиште контакти — надішлемо деталі доступу до курсу «Підготовка даних з pandas: від брудного файлу до даних для моделі».

Інші курси за підпискою

Термінал Linux (bash)

Основи Linux

Командний рядок з нуля: файли, права, процеси, мережа, bash-скрипти і SSH — у терміналі навчальної Ubuntu.

13 модулів · 40+ практичних завдань

JavaScript (Node.js)

Як працює веб: від URL до HTTPS, API і безпеки

Шлях запиту від URL до готової сторінки: DNS, TCP, TLS, HTTP, кеш, cookies, API і захист вебзастосунків.

11 модулів · 30+ практичних завдань

Часті питання про курс

Що це за курс?

«Підготовка даних з pandas: від брудного файлу до даних для моделі» — онлайн-курс за підпискою на навчальній платформі Prog Academy. Навчіться перетворювати сирі таблиці на дані, на яких модель справді може вчитися. Реальні дані рідко бувають чистими: зайві пробіли в назвах, ціни на кшталт "$1,299.00", дати в трьох форматах, дублікати клієнтів, пропуски там, де вони найменш доречні. Модель машинного навчання нічого з цим не зробить — їй потрібна акуратна числова таблиця. У цьому курсі ви крок за кроком опануєте pandas — головну бібліотеку Python для роботи з таблицями — і пройдете весь шлях: завантажити, оглянути, очистити, перетворити й віддати моделі масиви X та y.

Для кого цей курс?

Тим, хто знає базовий Python і хоче навчитися готувати реальні табличні дані для аналізу й моделей.

Які знання потрібні перед стартом?

Потрібно: базовий Python (змінні, списки, словники, цикли, функції). Досвід із NumPy корисний, але не обов'язковий, а знати машинне навчання не потрібно зовсім. Встановлювати нічого не треба — pandas і NumPy уже є в середовищі виконання.

Які практичні завдання будуть?

53 практичні завдання з автоматичною перевіркою: ви пишете справжній код pandas у вбудованому редакторі, а програма перевіряє його на прихованих наборах даних — із пропусками, дублікатами, порожніми результатами та іншими крайніми випадками, які трапляються в реальній роботі. Кожен розділ завершує тест на розуміння. Наприкінці — підсумковий проєкт: ви очищаєте «брудну» вивантажку з CRM і перетворюєте її на матрицю ознак для моделі.

Які технології використовуються?

Python, pandas. Код пишете й запускаєте прямо в браузері на платформі — встановлювати нічого не потрібно.

Скільки модулів містить курс?

13 модулів: DataFrame і завантаження даних; Огляд набору даних; Вибір рядків і фільтрація; Пропущені значення; Типи, текст і дублікати; Дати й час; Перетворення й агрегація; Об'єднання таблиць; Кодування й масштабування; Від таблиці до моделі; Інженерія ознак; Викиди й відбір ознак; Підсумковий проєкт: від брудного файлу до моделі. Практичних завдань з автоматичною перевіркою — 60+, тестів — 13.

Як отримати доступ?

Залиште заявку на цій сторінці й завершіть реєстрацію в Telegram-боті Prog Academy — там ви отримаєте подальші інструкції щодо доступу. Навчання проходить на платформі my.prog.academy у власному темпі.

Чи входить курс у підписку?

Так. Курс входить у підписку на платформі Prog Academy: доступ до всіх курсів за підпискою; ai-помічник з навчання в кожному курсі; усі уроки, домашні завдання та автоматична перевірка; нові курси за підпискою додаються автоматично.

Не знайшли відповідь?

Залиште запитання — підкажемо, чи підходить вам курс і з чого краще почати.