Резюме. Цель статьи – рассмотреть подходы к методам повышения качества прогнозирования и классификации несбалансированных данных и выбрать методы, позволяющие повысить точность классификации редких событий. При прогнозировании появления редких событий методами машинного обучения ученые сталкиваются с проблемой несоответствия качества обученных моделей их реальной способности правильно спрогнозировать появление редкого события. Предмет исследования в статье – обучение моделей при исходных несбалансированных данных. Объект исследования – информация об инцидентах и опасных событиях на объектах железнодорожного электроснабжения. Проблема несбалансированных данных выражается заметной диспропорции между типами наблюдаемых событий – количествами представителей различных классов. Методы. При работе с несбалансированными данными, в зависимости от характера задачи, качества и объема исходных данных, применяют различные методы повышения качества моделей классификации и прогнозирования Data Science. Часть этих методов направлена на работу с признаками и параметрами моделей классификации. К ним относятся методы FAST, CFS, нечёткие классификаторы, GridSearchCV и другие. Другая группа методов ориентирована на формирование репрезентативных подмножеств из исходного массив данных – сэмплов. Методы сэмплинга данных позволяют исследовать влияние пропорции классов на качество машинного обучения. В частности, в рамках настоящей статьи подробно рассматривается метод NearMiss. Результаты. Проблема дисбаланса классов при анализе количества инцидентов на объектах железнодорожного транспорта существуют с 2015 года. Несмотря на снижение доли опасных событий на объектах железнодорожного электроснабжения в течении трех лет с 2018 года, не исключен рост количества таких событий. Статистика долей опасных событий на уровне месяца демонстрирует отсутствие тренда на снижение и наличие пиков. В таких условиях эффективным периодом наблюдений за количеством инцидентов и опасных событий является месяц. Визуализация соотношения классов показала отсутствие выраженной границы между представителями класса большинства (инцидентами) и класса меньшинства (опасные события). Исследовалось соотношение классов в двух и трех измерениях в натуральных величинах и с применением метода главных компонент. Такая «близость» классов является одной из причин ошибок прогноза. В рамках работы проведен анализ имеющегося исследовательского опыта повышения качества машинного обучения при работе с несбалансированными данными. Определены и уточнены используемые для описания степени дисбалансов классов термины. Изучены сильные и слабые стороны различных методов работы с такими данными, приведено описание сильных и слабых сторон 50 методов. Из методов работы с количеством представителей классов при решении задачи классификации (прогнозирования появления) редких опасных событий на железнодорожном транспорте выбран метод NearMiss. Указанный метод позволяет проводить эксперименты с пропорциями представителей классов и методами отбора представителей классов. По результатам серии экспериментов удалось добиться повышения точности классификации редких опасных событий от 0 до 70-90%.
В статье приведено описание экспериментального автономного многофункционального комплекса для гидрографической съемки дна водоемов, состоящего из гидролокатора бокового обзора (ГБО) с линейной частотной модуляцией (ЛЧМ) зондирующих сигналов, приемника GPS, датчика курса и качки и Wi-Fi точки доступа. Экспериментальный образец установлен на радиоуправляемой модели катера. Экспериментальные результаты работы комплекса по обследованию дна небольшого пруда подтверждают перспективность его использования при проведении гидрографических изысканий.