Сообщения

Философия построения machine learning pipeline

Изображение
Философия построения machine learning pipeline Введение Этим постом мы открываем цикл статей о методологиях построения pipeline в машинном обучении. Здесь вы не найдете погружение в конкретные детали. Наша цель - верхнеуровнево понять, что есть хорошо, а что - плохо. Наша повесть - не о machine learning, а об инфраструктуре, которой вы должны окружить вашу модель для достижения конкретной цели, для удовлетворения бизнес-потребности. Речь пойдет не про ажурные и утонченные архитектуры, красивые сами в себе. Мы поговорим о молотке, которым можно будет забивать гвозди. Что делает решение успешным? Можно заметить, что зачастую применение простой baseline модели, с умом конечно же, дает ~95% точности суперзаточенного решения под конкретную область. Ниже представлены подходы, которые дают стабильное улучшение. Итак к сути, что же делает конкретное решение эффективным: Знание множества state-of-the-art алгоритмов? Увлечение инструментом вместо решения задач может создать пробл...

Перенос модели машинного обучения в production

Изображение
Перенос модели машинного обучения в production Весь код и конфиги из этой статьи доступны в репозитория GitHub. production_ml Pipeline для построения моделей машинного обучения часто заканчивается на этапе оценки качества модели: вы достигли приемлемой точности и на этом все. Кроме этого, возможно, вы еще построите красивые графики для вашей статьи/блога или же для вашей внутренней документации. Замечание : конечно от machine learning engineer не всегда требуется доведение модели до production. И даже если это нужно, эта часто задача делегируется системному администратору. Однако в настоящее время многие исследователи/инженеры несут (возможно моральную) ответственность за построение полного pipeline: от построения моделей до доведения их до production. Университетский проект это, личным эксперимент или же коммерческий продукт, демонстрация его работы является отличным способом заинтересовать широкую аудиторию. Немногие люди будут прилагать дополнительные усилия дл...

Подготовка данных для алгоритмов машинного обучения

Изображение
Описание стека и некоторые вводные В нашей статье мы будем использовать язык программирования python с сопутствующими ему библиотеки ( sklearn, matplotlib, seaborn ) и в качестве среды для работы jupyter notebook . Цель текущего поста - показать общие подходы к подготовке данных. То есть, те манипуляции, которые необходимо совершить перед загрузкой данных в модель машинного обучения. В идеальном мире у вас будет абсолютно чистый датасет без выбросов или пропущенных значений. Однако в реальном мире такие наборы данных встречаются крайне редко. Далее будем рассматривать данные из Kaggle: " Mental Health in Tech Survey ". Первый взгляд на датасет и понимание его специфики Трудно работать с данными, не понимая, что они из себя представляют, поэтому давайте их загрузим и выведем некоторые статистики. import pand as as pd import numpy as np df = pd . read_csv( "survey.csv" ) df . head () Это даст нам первое представление о том, что есть наши дан...

Задачи сегментации изображения с помощью нейронной сети Unet

Изображение
Сегментация изображений с U-Net на практике Введение В этом блог посте мы посмотрим как Unet работает, как реализовать его, и какие данные нужны для его обучения. Для этого мы будем рассматривать: Оригинальную статью Unet как источник для вдохновения. Pytorch как инструмент для реализации нашей задумки. Kaggle соревнования как место где мы можем опробовать наши гипотезы на реальных данных. Мы не будем следовать на 100% за статьей, но мы постараемся реализовать ее суть, адаптировать под наши нужды. Презентация проблемы Наша проблема это одно из Соревнований на kaggle . В этой задаче нам дано изображение машины и его бинарная маска(локализующая положение машины на изображении). Мы хотим создать модель, которая будет будет способна отделять изображение машины от фона с попиксельной точностью более 99%. Для понимания того что мы хотим, gif изображение ниже: Изображение слева - это исходное изображение, справа - маска, которая будет применяться на изображение. ...