Оглавление
- Предисловие
- Благодарности
- О книге
- Для кого эта книга
- Структура книги
- От издательства
- Об авторах
- Эмили Робинсон
- Жаклин Нолис
- Об обложке
- Часть 1. Data Science. С чего начать
- 1. Что такое Data Science?
- 1.1. Что такое Data Science?
- 1.1.1. Математика/статистика
- 1.1.2. Базы данных и программирование
- 1.1.3. Понимание бизнеса
- 1.2. Различные типы вакансий в Data Science
- 1.2.1. Аналитики
- 1.2.2. Машинное обучение
- 1.2.3. Теория принятия решений
- 1.2.4. Смежные специальности
- 1.3. Выбор пути
- 1.4. Интервью с Робертом Чангом, дата-сайентистом из Airbnb
- Итоги
- 2. Типы компаний в Data Science
- 2.1. КИТк: крупная информационно-технологическая компания
- 2.1.1. Команда: одна из многих в КИТк
- 2.1.2. Технология: продвинутая, но неупорядоченная
- 2.1.3. Плюсы и минусы КИТк
- 2.2. HandbagLOVE: устоявшийся ритейлер
- 2.2.1. Команда: небольшая группа, стремящаяся к росту
- 2.2.2. Технология: устаревшие методы, которые начинают меняться
- 2.2.3. Плюсы и минусы HandbagLOVE
- 2.3. Seg-Metra: стартап на ранней стадии
- 2.3.1. Команда (какая еще команда?)
- 2.3.2. Технология: передовые методы, собранные воедино
- Конец ознакомительного фрагмента
- Главная
- Жаклин Нолис
- 📚 Книги
- Data Science для карьериста
- Читать фрагмент
- 1.1.1. Математика/статистика1.1.1. Математика/статистика
1.1.1. Математика/статистика
На начальном уровне математика и статистика являются базой в работе с данными. Мы разделяем эту базу на три уровня знания:
• Существование методов. Если вы не знаете о какой-либо возможности, вы не можете ее использовать. Если дата-сайентисту нужно сгруппировать похожих клиентов, знание того, что это можно сделать статистическим методом (с помощью кластерного анализа), станет первым шагом.
• Как применять методы. Специалист по работе с данными должен не просто знать много методов – он должен различать нюансы их применения. Важно писать такой код, где они не только применяются, но и настраиваются. Если дата-сайентист хочет использовать кластеризацию методом k-средних, чтобы сгруппировать покупателей, он должен уметь делать это на языке программирования типа R или Python. Также он должен понимать, как настроить параметры метода, например как выбрать количество создаваемых групп.
• Как выбрать подходящий метод. В DS используется огромное количество методов, поэтому для дата-сайентиста важно быстро оценить, какой из них будет самым эффективным в каждом случае. В нашем примере с группировкой покупателей, даже если специалист сосредоточился на кластеризации, он может применять десятки различных методов и алгоритмов. Вместо того чтобы перебирать все доступные методы, он должен сразу отбросить бо́льшую их часть и сосредоточиться всего на нескольких.
Эти типы навыков постоянно применяются в задачах по работе с данными. Приведем другой пример. Предположим, вы работаете в компании, занимающейся e-commerce. Ваш бизнес-партнер может поинтересоваться, в каких странах у вас самый большой средний чек. Это очень простой вопрос, если у вас есть готовые данные. Но вместо того, чтобы просто предоставить информацию и позволить партнеру делать выводы самостоятельно, вы можете копнуть глубже. Если у вас есть один заказ из страны А на $100 и тысяча заказов из страны Б средней стоимостью $75, то формально в стране А средний чек выше. Но можете ли вы с уверенностью сказать, что ваш бизнес-партнер должен вложиться в рекламу в стране А, чтобы увеличить количество заказов? Вряд ли. У вас есть только одна единица данных из этой страны, и она может оказаться статистически незначимой. А вот если бы у вас было 500 заказов из страны А, можно было бы протестировать разницу в стоимости заказов. Это значит, что, если бы эти показатели для стран А и Б действительно не различались, вы бы не получили прежний результат. В этом длинном примере дается оценка того, какие подходы были разумными, что следует учитывать и какие результаты были признаны несущественными.