Logo
Decide better.Live better.
Logo
Decide better.Live better.

ИИ-проекты часто буксуют на этапе данных. Вот как избежать «мусора» в результатах. Узнайте, как аудит данных сэкономит ваш бюджет и почему роль Data Steward становится критически важной

Визуализация тщательной подготовки, проверки и очистки исходных данных, от которых зависит качество результатов ИИ.

Успех внедрения ИИ напрямую зависит от чистоты ваших данных. Узнайте, почему покупка новых инструментов без предварительной очистки баз — это путь к «высокотехнологичному мусору», и пошаговый план аудита, который поможет вам сократить расходы и получить реально работающие решения.

banner

Многие руководители ожидают, что искусственный интеллект решит бизнес-задачи автоматически, как только будет куплена подходящая лицензия. Однако успех внедрения ИИ зависит не только от мощности алгоритмов, но и от качества входной информации. Если данные содержат ошибки, искажения или противоречия, результатом могут стать неверные прогнозы, галлюцинации нейросетей и ошибочные управленческие решения. (source)

В контексте больших языковых моделей (LLM) и предиктивной аналитики, то есть прогнозирования на основе данных, принцип «Garbage In, Garbage Out» особенно важен. Надёжность результата зависит от качества данных, на которых модель обучалась, и контекста, который она получает в момент работы. Плохие данные могут заставить систему находить несуществующие закономерности или пропускать реальные тренды. Но качество данных само по себе не гарантирует успех: важны также соответствие модели задаче, корректная интеграция, настройки и проверка результатов.

Три проблемы с данными, которые тормозят развитие ИИ

Прежде чем внедрять ИИ, организации стоит разобраться с «техдолгом» в данных. Это накопленные за годы ошибки, пропуски и несогласованности, которые усложняют работу с информацией и удорожают проекты.

1. Разрозненные базы не дают целостной картины

Информация может быть распределена между маркетингом, продажами и службой поддержки. Если эти системы не обмениваются данными, ИИ не видит полный путь клиента. Из-за этого рекомендации и прогнозы строятся на неполной картине.

2. Разные названия создают дубликаты

Одна и та же компания может быть записана как «IBM», «I.B.M.» и «International Business Machines». Для сотрудника это очевидно, а для системы такие записи могут выглядеть как разные организации. В результате искажается агрегация данных и сложнее оценить реальный объём продаж или взаимодействий.

3. Устаревшие записи ведут к неверным решениям

Старые адреса, неактивные аккаунты и давно не обновлявшиеся сведения могут привести к неэффективным рассылкам и искажённой аналитике. Поэтому для каждой категории данных нужно заранее определить, как часто её следует обновлять.

Почему качество данных важнее покупки нового софта

Руководители нередко пытаются исправить плохие результаты с помощью более продвинутого инструмента. Однако окупаемость нового софта, то есть ROI, может оказаться низкой, если входные данные остаются неполными или противоречивыми. Очистка существующих баз не решает все задачи внедрения, но создаёт необходимую основу для дальнейшей работы.

Качественные данные повышают вероятность надёжного результата. При этом всё равно понадобятся интеграция, настройка, тестирование, обучение пользователей, оценка качества и контроль рисков. Даже самая сложная система не заменит эти этапы. Она лишь быстрее обработает исходные ошибки.

Российские организации сталкиваются с этой проблемой на практике. В докладе НИУ ВШЭ «Искусственный интеллект в России: разработка и применение» по итогам опроса 2023–2024 годов, опубликованного в 2025 году, недостаточность массивов данных назвали препятствием 31,9% организаций, не использующих ИИ, и 38,5% организаций, использующих ИИ. Неструктурированность, неполноту, пропуски и другие недостатки данных отметили 24,8% первых и 37,6% вторых.

Поэтому перед покупкой дорогой лицензии полезно сначала проверить одну базу, связанную с конкретной бизнес-задачей. Такой подход помогает увидеть реальную цену ошибок и не тратить бюджет на инструмент, которому пока не на чем надёжно работать.

Кто отвечает за порядок в данных

По мере роста роли данных компаниям может понадобиться отдельная функция управления их качеством. Её часто связывают с ролью Data Steward, то есть специалиста, который отвечает за качество, правила использования и целостность данных.

Такой специалист помогает устанавливать правила ввода информации, устранять несоответствия и следить за тем, чтобы данные оставались рабочим активом. Для компании, которая масштабирует ИИ, эта функция может быть не менее важна, чем разработка программного обеспечения или маркетинг. В небольшой организации часть задач Data Steward может выполнять уже существующий сотрудник, если у него есть время, полномочия и понятные правила работы.

Дорожная карта аудита данных для бизнеса

Прежде чем подписывать контракт на дорогую корпоративную лицензию ИИ, пройдите пять этапов. Они помогут понять, какие данные действительно влияют на результат и с чего начинать очистку.

1. Определите данные, которые влияют на цель

Выберите ключевые наборы данных, связанные с конкретной задачей. Это может быть система управления взаимоотношениями с клиентами (CRM), журналы складских операций или история продаж. Сначала проверяйте те данные, от которых зависит важное решение или показатель бизнеса.

2. Проверьте полноту записей

Посмотрите, сколько полей остаются пустыми. Особое внимание уделите номерам телефонов, датам покупок и географическим данным, если они нужны для выбранного сценария. Пропуск не всегда означает ошибку, но его влияние должно быть понятно заранее.

3. Сверьте точность и единообразие

Возьмите случайную выборку записей и проверьте, соответствует ли информация реальности. Затем сравните форматы в разных отделах. Например, даты, названия компаний и адреса должны обрабатываться по единым правилам.

4. Оцените актуальность

Определите, как часто обновляется каждый набор данных. Если информация не обновлялась более шести месяцев, она может быть непригодна для задач, требующих работы с данными почти в реальном времени. Для других сценариев такой срок может быть приемлемым, поэтому ориентируйтесь на конкретную задачу.

5. Рассчитайте стоимость ошибки

Оцените возможный ущерб от неверных данных. Это могут быть лишние контакты с клиентами, ошибки в прогнозе запасов или неправильное распределение бюджета. Затем приоритизируйте задачи по очистке: сначала работайте с базами, где цена ошибки выше всего.

Начните с небольшого аудита и одной измеримой задачи. Если данные прошли проверку, переходите к интеграции и тестированию инструмента. Так вы снизите риск бесполезных расходов, сократите количество переделок и сможете оценивать эффект ИИ на более надёжной основе. Подробнее: SAP отчитался о росте прибыли от ИИ: узнайте, стоит ли вам менять стратегию.

Лента