Prog Academy
RU UA

Курс по подписке

Подготовка данных с pandas: от грязного файла к данным для модели

Научитесь превращать сырые таблицы в данные, на которых модель действительно может учиться

  • 13 модулей
  • 60+ практических заданий
  • Автоматическая проверка
  • На русском

Получить доступ к курсу

Курс по подписке · Обучение в своём темпе

О курсе

Что это за курс?

Реальные данные редко бывают чистыми: лишние пробелы в названиях, цены вроде "$1,299.00", даты в трёх форматах, дубликаты клиентов, пропуски там, где они меньше всего уместны. Модель машинного обучения ничего с этим не сделает — ей нужна аккуратная числовая таблица. В этом курсе вы шаг за шагом освоите pandas — главную библиотеку Python для работы с таблицами — и пройдёте весь путь: загрузить, осмотреть, очистить, преобразовать и передать модели массивы X и y.

Аудитория

Для кого этот курс?

  • Знаете базовый Python

    Освоите pandas: будете читать CSV, фильтровать через loc, iloc и маски, группировать и соединять таблицы.

  • Работаете с «грязными» таблицами

    Будете чистить пропуски, типы, текст, даты и дубликаты — вплоть до итогового проекта с выгрузкой из CRM.

  • Готовите данные для модели

    Будете кодировать категории, масштабировать признаки без утечки данных и передавать модели массивы X и y.

Сначала нужна подготовка

Курс опирается на знания, отмеченные ниже как обязательные.

Нужно знать

  • Базовый Python (переменные, списки, словари, циклы, функции).

    Подробнее
    • Опыт с NumPy полезен, но не обязателен, а знать машинное обучение не нужно вовсе.
    • Устанавливать ничего не нужно — pandas и NumPy уже есть в среде выполнения.

Если этих знаний ещё нет — пройдите курсы по порядку:

  1. С нуля
  2. Обязательно Основы программирования на Python
  3. Этот курс Подготовка данных с pandas: от грязного файла к данным для модели

Результат

Чему вы научитесь

создавать DataFrame и читать CSV с нестандартными разделителями, заголовками и обозначениями пропусков

за минуту осматривать новый набор данных: типы, пропуски, распределения, подозрительные значения

выбирать строки и столбцы через loc, iloc и булевы маски, сортировать по нескольким ключам

находить, удалять и заполнять пропуски — в том числе медианой группы и предыдущим значением во временном ряду

исправлять типы, чистить текст через .str, разбирать даты и убирать дубликаты

вычислять новые столбцы без циклов, группировать, строить сводные таблицы и менять форму данных

соединять таблицы через concat и merge и ловить ошибки ключей до того, как они испортят результат

кодировать категории, масштабировать признаки без утечки данных, делить выборку на train и test

конструировать новые признаки, находить выбросы и отбрасывать бесполезные столбцы

Формат

Как устроено обучение?

53 практических задания с автоматической проверкой: вы пишете настоящий код pandas во встроенном редакторе, а программа проверяет его на скрытых наборах данных — с пропусками, дубликатами, пустыми результатами и другими крайними случаями, которые встречаются в реальной работе. Каждый раздел завершается тестом на понимание. В конце — итоговый проект: вы очищаете «грязную» выгрузку из CRM и превращаете её в матрицу признаков для модели.

  • Теория

    32 урока с примерами

  • Практика в браузере

    60+ заданий с автоматической проверкой

  • Тесты

    13 тестов для самопроверки

  • Свой темп

    Онлайн на my.prog.academy, без установки программ

AI-помощник

AI-помощник рядом во время обучения

На страницах курса, уроков и заданий есть кнопка «Спросить AI». Помощник знает материалы именно этого курса и урок, на котором вы сейчас, поэтому отвечает по теме и показывает, в каких уроках об этом говорится.

  • Объяснит иначе

    Не поняли урок с первого раза — попросите объяснить проще или привести ещё один пример.

  • Поможет с заданием

    Застряли — подскажет, с чего начать, и поможет найти ошибку в вашем решении. Готового решения не даёт.

  • Найдёт нужную тему

    Спросите, где объясняли понятие, — и получите ссылки на нужные уроки курса.

  • Продолжит разговор

    Уточняйте без повторов: помощник помнит разговор, а недавние разговоры курса сохраняются.

Входит в каждый тариф оплаченной подписки — Basic и Premium. В Premium лимиты использования AI-помощника выше — им можно пользоваться активнее. Это помощник в обучении, а не генератор готовых ответов: он объясняет и подсказывает, а задания вы решаете сами.

Программа

Программа курса

13 модулей, 60+ практических заданий с автоматической проверкой и 13 тестов. Откройте модуль, чтобы увидеть все темы.

Раздел 1 — DataFrame и загрузка данных 4 урока · 4 практики · 1 тест

Зачем готовить данные перед анализом и путь данных в курсе; Series и DataFrame, создание таблиц из словарей и записей, read_csv с нестандартными параметрами, выбор и переименование столбцов

  • Теория Зачем чистить данные: от сырой выгрузки к модели
  • Теория Зачем pandas: таблица как объект Python
  • Практика DataFrame из JSON
  • Теория read_csv: разделители, заголовки, пропуски
  • Практика Выгрузка без заголовка
  • Теория Столбцы: выбор, переименование, чистые названия
  • Практика Чистые названия столбцов
  • Практика Признаки и целевая переменная
  • Тест DataFrame и загрузка данных
Раздел 2 — Обзор набора данных 3 урока · 4 практики · 1 тест

Первый взгляд на новые данные: форма, типы, заполненность, описательная статистика, распределения категорий и чек-лист качества

  • Теория Первый взгляд: shape, head, info, dtypes
  • Практика Профиль столбцов
  • Теория Описательная статистика и распределения
  • Практика Статистика числовых столбцов
  • Практика Доли категорий
  • Теория Чек-лист качества данных
  • Практика Сканер качества данных
  • Тест Обзор набора данных
Раздел 3 — Выбор строк и фильтрация 3 урока · 5 практик · 1 тест

loc и iloc, булевы маски с несколькими условиями, isin и between, пропуски в сравнениях, сортировка по нескольким ключам

  • Теория loc и iloc: метки и позиции
  • Практика Loc или iloc — что именно будет выбрано
  • Практика Loc против iloc
  • Теория Булевы маски: условия, isin, between, query
  • Практика Фильтр каталога
  • Практика Какие заказы проверить
  • Теория Сортировка: несколько ключей, пропуски, наибольшие значения
  • Практика Сортировка каталога и топ по рейтингу
  • Тест Выбор и фильтрация
Раздел 4 — Пропущенные значения 3 урока · 7 практик · 1 тест

Как выглядят пропуски в pandas, как их посчитать, когда удалять строки и столбцы, чем и как заполнять — в том числе по группам и во временных рядах

  • Теория Пропуски: как выглядят и как их посчитать
  • Практика Отчёт о пропусках
  • Теория Удалить или заполнить: dropna и fillna
  • Практика Сколько строк оставит dropna
  • Практика Правила удаления
  • Практика Заполнение медианой и модой
  • Теория Заполнение по группам и во времени
  • Практика Чем заполнить пропуск
  • Практика Медиана отдела
  • Практика Пропуски в показаниях датчиков
  • Тест Пропущенные значения
Раздел 5 — Типы, текст и дубликаты 3 урока · 6 практик · 1 тест

Преобразование типов и to_numeric с errors, nullable-типы и категории, очистка текста через.str, регулярные выражения, поиск и удаление дубликатов

  • Теория Типы данных: to_numeric, astype, nullable-типы, категории
  • Практика Диагноз типов по info()
  • Практика Цены с символами
  • Практика Целые, булевы и категории
  • Теория Очистка текста: аксессор.str и регулярные выражения
  • Практика Одно название города
  • Практика Коды из сообщений
  • Теория Дубликаты: точные и «почти одинаковые»
  • Практика Клиенты без повторов
  • Тест Типы, текст и дубликаты
Раздел 6 — Даты и время 3 урока · 3 практики · 1 тест

to_datetime с явным форматом и errors='coerce', аксессор.dt, разница дат в группах, resample и периоды

  • Теория to_datetime: разбор дат без сюрпризов
  • Практика Разбор дат и дни недели
  • Теория Признаки из дат:.dt, разницы, группы
  • Практика Признаки из времени заказа
  • Теория Группировка по времени: resample и периоды
  • Практика Продажи по месяцам
  • Тест Даты и время
Раздел 7 — Преобразование и агрегация 3 урока · 6 практик · 1 тест

Новые столбцы без циклов: assign, np.where, map, clip; когда apply уместен, а когда нет; groupby с именованными агрегатами и transform; pivot_table и melt

  • Теория Новые столбцы без циклов: assign, np.where, map
  • Практика Сумма, скидка, купон
  • Практика Стоимость доставки
  • Теория groupby: разделить, применить, объединить
  • Практика Статистика отделов
  • Практика Доля в сумме клиента
  • Теория Изменение формы: pivot_table и melt
  • Практика Сводная таблица продаж
  • Практика Из широкой таблицы в длинную
  • Тест Преобразование и агрегация
Раздел 8 — Объединение таблиц 3 урока · 5 практик · 1 тест

concat для частей одной таблицы, merge по ключу и четыре типа соединений, проверка ключей через validate и сверка источников через indicator

  • Теория concat: собрать части в одну таблицу
  • Практика Склеить выгрузки
  • Теория merge: соединение таблиц по ключу
  • Практика Продажи по странам
  • Теория Проверки при слиянии: validate и indicator
  • Практика Сколько строк даст merge
  • Практика Безопасный справочник цен
  • Практика Сверка склада
  • Тест Объединение таблиц
Раздел 9 — Кодирование и масштабирование 2 урока · 6 практик · 1 тест

Порядковое кодирование и one-hot, одинаковые столбцы для train и test, min-max и стандартизация без утечки данных

  • Теория Категории в числа: порядковое кодирование и one-hot
  • Практика Как закодировать признак
  • Практика Порядковые коды
  • Практика One-hot через get_dummies
  • Практика Одинаковые столбцы для train и test
  • Теория Масштабирование: min-max, стандартизация и утечка данных
  • Практика Min-max масштабирование
  • Практика Стандартизация без утечки
  • Тест Кодирование и масштабирование
Раздел 10 — От таблицы к модели 1 урок · 3 практики · 1 тест

Портрет целевой переменной и баланс классов, воспроизводимое и стратифицированное разбиение на train и test, массивы X и y с проверками

  • Теория От таблицы к X и y: баланс классов и разбиение на train/test
  • Практика Портрет классов
  • Практика Воспроизводимое разбиение
  • Практика X и y для модели
  • Тест От таблицы к модели
Раздел 11 — Инженерия признаков 1 урок · 4 практики · 1 тест

Новые признаки из имеющихся: отношения и безопасное деление, условия через np.select, интервалы через pd.cut, признаки из текста

  • Теория Новые признаки: отношения, условия, интервалы, текст
  • Практика ИМТ и маржа
  • Практика Возрастные группы через pd.cut
  • Практика Ценовые сегменты через np.select
  • Практика Признаки из отзывов
  • Тест Инженерия признаков
Раздел 12 — Выбросы и отбор признаков 2 урока · 5 практик · 1 тест

Выбросы по правилу IQR, обрезка по квантилям, удаление бесполезных признаков и корреляция с целевой переменной

  • Теория Выбросы: найти и укротить
  • Практика Границы IQR и что делать с выбросом
  • Практика Выбросы по IQR
  • Практика Обрезка по квантилям
  • Теория Отбор признаков: что убрать, что оставить
  • Практика Убрать бесполезные признаки
  • Практика Какие признаки связаны с целевой переменной
  • Тест Выбросы и отбор признаков
Раздел 13 — Итоговый проект: от грязного файла до модели 1 урок · 3 практики · 1 тест

Весь конвейер подготовки данных в двух заданиях: очистка реальной выгрузки из CRM и построение матрицы признаков для модели

  • Теория Конвейер подготовки данных: порядок шагов
  • Практика Порядок шагов конвейера
  • Практика Проект, часть 1: очистка выгрузки из CRM
  • Практика Проект, часть 2: матрица признаков для модели
  • Тест Итоговый тест курса

Стек

Какие технологии используются?

  • Python
  • pandas

Код пишете и запускаете в браузере на платформе — устанавливать ничего не нужно.

Применение

Где применяются эти знания?

  1. Подготовка датасетов для моделей машинного обучения
  2. Аналитика и отчёты на Python
  3. Очистка выгрузок из CRM, магазинов и логов

Доступ

Как получить доступ?

  1. Оставьте заявку

    Заполните короткую форму на этой странице.

  2. Завершите регистрацию в Telegram

    После заявки перейдите в Telegram-бот Prog Academy — он пришлёт дальнейшие инструкции по доступу.

  3. Учитесь на платформе

    Уроки, практика и тесты — на my.prog.academy, в удобном для вас темпе.

Контакт

Начните обучение на платформе

Оставьте контакты — пришлём детали доступа к курсу «Подготовка данных с pandas: от грязного файла к данным для модели».

Другие курсы по подписке

Терминал Linux (bash)

Основы Linux

Командная строка с нуля: файлы, права, процессы, сеть, bash-скрипты и SSH — в терминале учебной Ubuntu.

13 модулей · 40+ практических заданий

Кибербезопасность с ИИ: защита от современных атак и безопасная работа с искусственным интеллектом

Защита от современных атак для нетехнических специалистов: фишинг, пароли и MFA, инциденты, дипфейки и безопасная работа с ИИ.

12 модулей · 30+ практических заданий

Частые вопросы о курсе

Что это за курс?

«Подготовка данных с pandas: от грязного файла к данным для модели» — онлайн-курс по подписке на учебной платформе Prog Academy. Научитесь превращать сырые таблицы в данные, на которых модель действительно может учиться. Реальные данные редко бывают чистыми: лишние пробелы в названиях, цены вроде "$1,299.00", даты в трёх форматах, дубликаты клиентов, пропуски там, где они меньше всего уместны. Модель машинного обучения ничего с этим не сделает — ей нужна аккуратная числовая таблица. В этом курсе вы шаг за шагом освоите pandas — главную библиотеку Python для работы с таблицами — и пройдёте весь путь: загрузить, осмотреть, очистить, преобразовать и передать модели массивы X и y.

Для кого этот курс?

Тем, кто знает базовый Python и хочет научиться готовить реальные табличные данные для анализа и моделей.

Какие знания нужны перед стартом?

Нужно: базовый Python (переменные, списки, словари, циклы, функции). Опыт с NumPy полезен, но не обязателен, а знать машинное обучение не нужно вовсе. Устанавливать ничего не нужно — pandas и NumPy уже есть в среде выполнения.

Какие практические задания будут?

53 практических задания с автоматической проверкой: вы пишете настоящий код pandas во встроенном редакторе, а программа проверяет его на скрытых наборах данных — с пропусками, дубликатами, пустыми результатами и другими крайними случаями, которые встречаются в реальной работе. Каждый раздел завершается тестом на понимание. В конце — итоговый проект: вы очищаете «грязную» выгрузку из CRM и превращаете её в матрицу признаков для модели.

Какие технологии используются?

Python, pandas. Код пишете и запускаете прямо в браузере на платформе — устанавливать ничего не нужно.

Сколько модулей в курсе?

13 модулей: DataFrame и загрузка данных; Обзор набора данных; Выбор строк и фильтрация; Пропущенные значения; Типы, текст и дубликаты; Даты и время; Преобразование и агрегация; Объединение таблиц; Кодирование и масштабирование; От таблицы к модели; Инженерия признаков; Выбросы и отбор признаков; Итоговый проект: от грязного файла до модели. Практических заданий с автоматической проверкой — 60+, тестов — 13.

Как получить доступ?

Оставьте заявку на этой странице и завершите регистрацию в Telegram-боте Prog Academy — там вы получите дальнейшие инструкции по доступу. Обучение проходит на платформе my.prog.academy в своём темпе.

Входит ли курс в подписку?

Да. Курс входит в подписку на платформе Prog Academy: доступ ко всем курсам по подписке; ai-помощник по обучению в каждом курсе; все уроки, домашние задания и автоматическая проверка; новые курсы по подписке добавляются автоматически.

Не нашли ответ?

Оставьте вопрос — подскажем, подходит ли вам курс и с чего лучше начать.