Data Science. Лучшие практики
Год издания: 2026
Автор: Воган Дэниел
Перевод: Жевлакова Е.
Издательство: Астана
ISBN: 978-601-12-7679-5
Серия: O'Reilly. Книги по программированию
Язык: Русский
Формат: PDF
Качество: Отсканированные страницы
Количество страниц: 290
Описание: Не только владение определенными методами и практиками, но и умение применять их там, где это действительно имеет значение, отличает хорошего специалиста по данным от выдающегося. Эта книга для тех, кто хочет выйти за рамки учебных примеров и научиться строить проекты, приносящие ощутимую ценность бизнесу.
Автор делится проверенными подходами , которые редко встречаются в классических курсах. В центре внимания не только техника, но и практическое мастерство: как убедительно презентовать результаты, как формулировать с ильные аргументы, как превращать аналитику в реальные решения.
Настольный справочник для тех, кто стремится не просто «работать с данными», а создавать проекты, которые влияют на решения и меняют процессы. Она будет одинаково полезна как амбициозным новичкам, так и опытным дата-сайентистам, желающим прокачать навыки и повысить эффективность своей работы.
Примеры страниц (скриншоты)
Оглавление
Предисловие
Условные обозначения, используемые в этой книге
Использование примеров кода
Онлайн-обучение в O'Reilly
Как с нами связаться
Благодарности
Часть I
Методы анализа данных
Глава 1. Что дальше? Создание ценности с помощью Data science
Что такое ценность?
Что: хорошо разбираться в бизнесе
Что дальше: суть создания ценности посредством науки о данных
Что делать сейчас: проявляйте инициативу
Измерение ценности
Основные выводы
Дополнительная литература
Глава 2. Разработка метрик
Полезные свойства метрик
Декомпозиция метрик
Другой вариант декомпозиции выручки
Пример с маркетплейсами
Основные выводы
Дополнительная литература
Глава 3. Декомпозиции роста: попутные и встречные ветры
Почему именно декомпозиция роста?
Аддитивная декомпозиция
Мультипликативная декомпозиция
Декомпозиция mix-rate
Математические производные
Основные выводы
Дополнительная литература
Глава 4. Матрицы 2х2
Аргументы в пользу упрощения
Что такое матрица 2х2?
Пример: тестируем модель и новый признак
Пример: анализируем поведение пользователя
Пример: оформление и одобрение кредита
Пример: расстановка приоритетов в рабочем процессе
Основные выводы
Дополнительная литература
Глава 5. Создание бизнес-кейсов
Принципы создания бизнес-кейсов
Пример: проактивная стратегия удержания
Предотвращение мошенничества
Приобретение внешних наборов данных
Работа над проектом по Data science
Основные выводы
Дополнительная литература
Глава 6. Что показывает прирост?
Расчет прироста
Пример: модель классификации
Свободный выбор и смещение по выживаемости
Другие варианты использования прироста
Основные выводы
Дополнительная литература
Глава 7. Нарративы
Нарративы: рассказать историю, используя свои данные
Практическая применимость
Создание нарратива
Последний рывок
Основные выводы
Дополнительная литература
Глава 8. Datavis: выбираем диаграмму для передачи идеи
Некоторые полезные и не очень методы визуализации данных
Общие рекомендации
Основные выводы
Дополнительная литература
ЧАСТЬ II
Машинное обучение
Глава 9. Моделирование и бутстрэп
Основы моделирования
Моделирование линейной модели и линейной регрессии
Что такое графики частичной зависимости?
Смещение вследствие пропущенных переменных
Моделирование задач классификации
Бутстрэп
Основные выводы
Дополнительная литература
Глава 10. Линейная регрессия: возвращаемся к основам
Что определяет коэффициент?
Теорема Фриша-Во-Ловелла
Чем полезна теорема Фриша-Во-Ловелла?
Конфаундеры
Дополнительнвые переменные
Ключевая роль дисперсии в ML
Основные выводы
Дополнительная литература
Глава 11. Утечка данных
Что такое утечка данных?
Обнаружение утечки данных
Полное разделение
Метод скользящего окна (Windowing Methodology)
Утечка данных: что делать сейчас?
Основные выводы
Дополнительная литература
Глава 12. Вывод модели в продакшн
Что означает « готовность к продакшну»?
Дрейф данных и модели
Основные этапы любого конвейера в продакшне
Основные выводы
Дополнительная литература
Глава 13. Сторителлинг в машинном обучении
Целостный взгляд на сторителлинг в ML
Ех ante и interim сторителлинг
Сторителлинг ех post: открываем черный ящик
Основные выводы
Дополнительная литература
Глава 14. От прогнозирования к принятию решений
Анализ процесса принятия решений
Простые правила принятия решений с помощью интеллектуального
определения пороговых значений (Smart Thresholding)
Оптимизация матрицы несоответствий
Основные выводы
Дополнительная литература
Глава 15. Инкрементальность: святой Грааль науки о данных?
Что такое инкрементальность
Конфаундеры и коллайдеры
Смещение выборки
Допущение об отсутствии смещения
Преодоление смещения выборки: рандомизация
Мэтчинг
Машинное обучение и причинно-следственный вывод
Основные выводы
Дополнительная литература
Глава 16. А/В-тесты
Что такое А/В-тест?
Критерии принятия решения
Минимальные обнаруживаемые эффекты
Бэклог гипотез
Управление экспериментами
Основные выводы
Дополнительная литература
Глава 17. Большие языковые модели и наука о данных в работе
Текущее состояние ИИ
Чем занимаются дата-сайентисты?
Эволюция должностных обязанностей дата-сайентистов
LLM и эта книга
Основные выводы
Дополнительная литература
Об авторе
Колофон