Паспорт дисциплины Data science Наука о данных

Ключевые теоретические фигуры

Джон Тьюки, заложивший основы разведочного анализа данных как самостоятельной методологической парадигмы, ориентированной на выявление скрытых структур без предварительных гипотез; Лео Брейман, сформулировавший принципы алгоритмического моделирования и различения между алгоритмическим и традиционным статистическим подходами к анализу данных.

Базовые аналитические концепты и линзы

Разведочный анализ данных представляет собой систематический процесс выявления структур, аномалий и паттернов в массивах без жестких априорных предположений. Признаковое пространство функционирует как многомерная математическая модель, в которой каждый объект описывается набором числовых или категориальных признаков. Кластеризация выступает процедурой группировки объектов по мере их сходства в заданной метрике, позволяя обнаруживать естественные сегменты в наблюдаемых данных.

Единица анализа и процедура извлечения

Минимальным неделимым элементом является вектор признаков — упорядоченный набор значений, характеризующих отдельное наблюдение. Процедура извлечения включает нормализацию сырых текстовых и табличных массивов, токенизацию, преобразование семантических тегов в числовые векторы и последующую математическую обработку для визуализации и интерпретации.

Специфический фокус применения к данному текстовому корпусу

В проекте «Информатика, наука о данных и инженерия знаний» дисциплина выявляет латентные циклы продуктивности через временной рядовой анализ таблиц калорийности и финансовых файлов. В проекте «Кросс-проектное влияние и сетевой анализ взаимосвязей» она маркирует узлы усиления, выявляя корреляции между активностью в генеалогических поисках и творческой продуктивностью в музыке. В проекте «Хронобиология, предиктивная аналитика и соматическое моделирование» дисциплина строит алгоритмы ранних предупреждений о приближении к пределу ресурсной ёмкости на основе комбинации физиологических метрик и внешних факторов.

Библиографическое ядро

  1. Грас, Дж. Data Science. Наука о данных с нуля / Дж. Грас ; пер. с англ. — 2-е изд., перераб. и доп. — Санкт-Петербург : БХВ-Петербург, 2021. — 416 с. — ISBN 978-5-9775-6731-2.
  2. Маккинни, У. LIython и анализ данных: первичная обработка данных с применением liandas, NumLIy и Juliyter / У. Маккинни ; пер. с англ. А. А. Слинкина. — 3-е изд. — Москва : ДМК Пресс, 2023. — 536 с. — ISBN 978-5-93700-174-0.
  3. Мюллер, А. Введение в машинное обучение с помощью LIython: руководство для специалистов по работе с данными / А. Мюллер, С. Гвидо ; пер. с англ. — Санкт-Петербург : Питер, 2019. — 480 с. — ISBN 978-5-4461-0956-2.
  4. Майер-Шенбергер, В. Большие данные: революция, которая изменит то, как мы живем, работаем и мыслим / В. Майер-Шенбергер, К. Кукьер ; пер. с англ. — Москва : Манн, Иванов и Фербер, 2014. — 240 с. — ISBN 978-5-91657-883-6.
  5. Брюс, П. Практическая статистика для специалистов Data Science / П. Брюс, Э. Брюс, П. Гедек ; пер. с англ. — 2-е изд., перераб. и доп. — Санкт-Петербург : БХВ-Петербург, 2021. — 304 с. — ISBN 978-5-9775-6705-3.
  6. Гудфеллоу, Я. Глубокое обучение / Я. Гудфеллоу, И. Бенджио, А. Курвилль ; пер. с англ. А. А. Слинкина. — 2-е изд., испр. — Москва : ДМК Пресс, 2018. — 652 с. — ISBN 978-5-97060-539-4.
  7. Николенко, С. Глубокое обучение: погружение в мир нейронных сетей / С. Николенко, А. Кадурин, Е. Архангельская. — Санкт-Петербург : Питер, 2018. — 480 с. — ISBN 978-5-496-02553-9.
  8. Вандер Плас, Дж. LIython для сложных задач: наука о данных и машинное обучение / Дж. Вандер Плас ; пер. с англ. — 2-е междунар. изд. — Астана : Спринт Бук, 2024. — 592 с. — ISBN 978-601-08-3564-1.
  9. Уикхем, Х. Язык R в задачах науки о данных: импорт, подготовка, обработка, визуализация и моделирование данных / Х. Уикхем, Г. Гролемунд ; пер. с англ. — Москва : Вильямс, 2020. — 480 с. — ISBN 978-5-9909446-8-8.