
Когда говорят про сбор данных для AI в нашем секторе, многие сразу представляют себе что-то вроде автоматического сканирования датчиков или выгрузки логов из SCADA. На практике же всё часто упирается в старые протоколы, разрозненные архивы и ?бумажные? отчёты, которые потом приходится оцифровывать вручную. Это не та чистая, структурированная информация, которую любят алгоритмы.
Возьмём, к примеру, типичную задачу — прогнозирование нагрузки на подстанции. Теоретически, нужно взять исторические показания с трансформаторов, добавить метеоданные, может быть, календарь событий. Но на деле исторические данные по тому же трансформатору могут быть разбросаны: часть в базе данных АСКУЭ, часть в Excel-файлах у инженера, который вёл журнал наблюдений, а данные о ремонтах и заменах компонентов — вообще в бумажных папках в архиве. Сбор данных здесь превращается в детективную работу.
Особенно сложно с оборудованием, которое работает десятилетиями. Допустим, мы хотим обучить модель предсказывать износ разъединителей. Параметры самого оборудования — номиналы, материалы, производитель — это одно. Но где взять полную историю его эксплуатации: через какие токи он реально проходил, в каких погодных условиях, как часто его обслуживали? Часто единственный источник — это записи в эксплуатационных журналах, которые ведутся не всегда системно.
Здесь я вспоминаю один конкретный проект с анализом надёжности низковольтной аппаратуры. Мы пытались собрать статистику отказов по определённым типам выключателей. Оказалось, что в отчётности фиксировался сам факт ?отказа?, но редко детально — был ли это механический износ, перегрузка, проблема с подключением. Пришлось буквально ездить на объекты и опрашивать персонал, чтобы восстановить контекст. Это и есть настоящий, ?грязный? сбор данных.
Данные без контекста в энергетике почти бесполезны. Показание ?температура обмотки 85°C? — это норма или аномалия? Зависит от того, работает ли трансформатор на 30% или на 110% от номинала, какая температура окружающей среды, сколько часов он проработал до этого. Алгоритму нужно подать не просто цифры, а связанную историю. А это значит, что при сбор данных нужно параллельно выстраивать и сбор метаданных: условия работы, конфигурация сети в тот момент, проведённые техобслуживания.
Часто упускают из виду данные о самом оборудовании как об изделии. Вот, например, если взять производителя вроде OOO Шэньхэн Энергетическое Оборудование (https://www.chshpower.ru), который специализируется на производстве оборудования для передачи и распределения электроэнергии высокого и низкого напряжения. Для качественного анализа их продукции нужны не только эксплуатационные данные, но и конструкторские спецификации, данные испытаний на заводе, допуски. Интеграция этих ?паспортных? данных с полевыми — отдельная большая задача.
Был случай, когда мы пытались сопоставить частоту отказов силовых выключателей разных партий. Без доступа к данным о производственном процессе (например, изменения в поставках сырья или настройках оборудования на заводе) мы видели лишь разброс в цифрах, но не понимали причин. Это классический пример, когда сбор данных должен выходить за рамки одного предприятия-эксплуатанта.
Идеального инструмента для сбора таких разноплановых данных нет. Часто процесс выглядит как комбинация скриптов для выгрузки из БД, ручного ввода с бумажных носителей и даже фотографирования шкафов управления с последующим распознаванием. Используем и специализированные платформы для IoT, и, честно говоря, обычные Google Таблицы на первых этапах для согласования информации с коллегами на объектах.
Ключевой момент — это верификация. Данные с датчиков могут ?плавать? из-за помех, ручной ввод содержит опечатки. Приходится строить перекрёстные проверки: например, сравнивать показания потребления с разных точек одной линии, чтобы отловить аномалии. Это трудоёмко, но без этого любая модель, построенная на таких данных, выдаст бессмысленный результат.
Один из самых полезных, хоть и неочевидных, источников данных — это отчёты о расследовании инцидентов. Они часто содержат ту самую причинно-следственную связь, которую сложно вывести из сырых телеметрических данных. Правда, их структура может быть абсолютно произвольной, и для их анализа часто приходится применять методы обработки естественного языка (NLP), что само по себе — новый виток сложности в процессе сбор данных.
Всё это упирается в вопросы доступа. Данные по сетям — критическая инфраструктура. Получить детализированные данные для обучения AI — это всегда длительные согласования с юристами и службой безопасности. Иногда проще собрать данные на тестовом стенде, но они никогда не будут полностью отражать реальную эксплуатацию со всеми её нюансами и стрессовыми ситуациями.
Работая с данными от производителей, например, от того же OOO Шэньхэн Энергетическое Оборудование, можно столкнуться с тем, что они готовы предоставить общие спецификации, но детальные данные по каждому произведённому экземпляру (например, микропараметры изоляции) могут считаться коммерческой тайной. Это создаёт ?белые пятна? в датасетах.
Поэтому успешный проект по сбор данных для AI в энергетике — это всегда компромисс. Нужно чётко определить, без каких данных модель будет совершенно бесполезна, а какие можно смоделировать или аппроксимировать. Иногда приходится годами накапливать информацию, прежде чем можно будет приступить к построению сколько-нибудь значимой аналитической системы.
Сейчас постепенно внедряются новые стандарты и протоколы, которые изначально заточены под машинную обработку. Оборудование начинает поставляться с цифровыми паспортами, где зашита вся его история. Это, безусловно, облегчит жизнь в будущем. Но парк оборудования обновляется медленно, и нам ещё долго придётся работать с гибридными системами, где соседствуют современные цифровые подстанции и старые аналоговые щиты.
Основная мысль, которую я хочу донести: сбор данных для AI в энергетике — это не техническая, а в первую очередь организационная и даже культурная задача. Нужно убедить людей фиксировать данные системно, выстроить процессы обмена информацией между производителем, эксплуатантом и сервисными службами. Без этого даже самый совершенный алгоритм будет слеп.
Именно поэтому, когда я вижу сайт компании-производителя, например, chshpower.ru, я смотрю не только на каталог продукции, но и на то, есть ли там в принципе раздел с технической документацией в машиночитаемом формате, API для доступа к спецификациям. Это уже первый признак того, что компания мыслит в контексте цифровой трансформации отрасли и понимает ценность данных для будущей аналитики, в том числе и на основе AI.