Подготовлено RD media
У разработчиков ИИ появляется новый дефицитный ресурс — записи того, как люди реально работают.
По данным The Information, спрос на внутренние корпоративные данные резко вырос. Покупателей интересуют переписки сотрудников, электронная почта, записи видеоконференций, история изменений кода и другие цифровые следы рабочих процессов.
Среди компаний, проявляющих интерес к таким данным, издание называет OpenAI и Anthropic.
Причина — переход индустрии от чат-ботов к ИИ-агентам.
Интернет хорошо учит модель отвечать на вопрос «что это?». Агенту, которому поручают проверить счёт, разобраться с жалобой клиента или исправить ошибку в коде, требуется другое знание: как именно выполняется работа.
Большая часть этого знания никогда не публиковалась в интернете. Она находится внутри компаний.
В Slack и электронной почте видно, как сотрудники обсуждают проблему. В истории Git — какие решения оказались ошибочными и как их исправили. В записях совещаний — как менеджеры выбирают между несколькими вариантами. В переписке с клиентами — как сотрудник доводит проблему до решения.
Для обучения ИИ-агентов такие последовательности могут оказаться ценнее огромных массивов обычных веб-страниц.
Рынок начинает реагировать
Показательный случай — стартап Warmly. После соглашения о его покупке HubSpot компания получила предложение от Mercor, платформы, которая привлекает специалистов для проектов по обучению и оценке ИИ-моделей, купить или лицензировать её кодовую базу и записи рабочих процессов.
Это не единичный интерес. Глава брокера данных Protege Бобби Сэмюэлс сообщил The Information, что совокупный объём сделок компании вырос примерно с $30 млн в прошлом году как минимум до $100 млн в этом.
Рынок пока только формируется: отдельные предложения и рост бизнеса одного брокера не доказывают существование зрелого рынка корпоративных данных. Но они показывают, что информация, которая раньше практически не имела отдельной цены, начинает её получать.
Почему данные стали настолько ценными
У масштабирования ИИ на человеческих текстах появляется ограничение.
Epoch AI оценивает эффективный запас качественных публичных текстов, созданных людьми, примерно в 300 трлн токенов. По оценке исследователей, при сохранении прежних тенденций запас публичных текстовых данных может стать ограничивающим фактором для дальнейшего масштабирования в период с 2026 по 2032 год.
Интернет продолжает пополняться: появляются новые тексты, изображения, видео, аудио, закрытые базы и синтетические данные.
Проблема заключается в соотношении скоростей: потребность в обучающих данных растёт быстрее, чем появляется новый качественный человеческий текст.
Но для ИИ-агентов есть ещё одна причина искать данные внутри компаний.
Им нужен не только результат работы, но и траектория его получения:
задача → обсуждение → ошибка → корректировка → решение
Именно такой информации особенно мало в открытом интернете.
Ценность process data — данных о том, как люди выполняют работу и принимают решения — растёт вслед за спросом на многолетние вычислительные мощности для обучения моделей.
Вместе с ценностью появляется юридическая проблема
Корпоративная переписка создавалась для работы, а не для обучения ИИ.
В ней могут находиться персональные данные сотрудников и клиентов, коммерческие тайны, финансовая информация, внутренний код и сведения, защищённые соглашениями о конфиденциальности.
Купить такой массив недостаточно. Его необходимо очистить и обезличить, а покупателю — получить необходимые права на его использование.
История Anthropic показывает, насколько дорогими могут стать ошибки при происхождении обучающих данных.
20 июля 2026 года федеральный суд США окончательно утвердил соглашение Anthropic на $1,5 млрд по коллективному иску авторов. Суд признал обучение на легально приобретённых книгах допустимым в рамках fair use. Спор касался пиратского происхождения и хранения миллионов нелегальных копий.
С корпоративными данными правовая конструкция может оказаться ещё сложнее.
Кому принадлежат права на рабочую переписку между пятью сотрудниками, клиентом и внешним подрядчиком? Достаточно ли согласия работодателя, если участники разговора никогда не предполагали, что их сообщения станут материалом для обучения ИИ?
Есть и более фундаментальный вопрос.
Получается, что вместе с результатом работы сотрудник оставляет компании ещё один потенциально ценный актив — цифровой след того, как эта работа была выполнена.
Раньше такой цифровой след редко рассматривался как самостоятельный коммерческий актив. Теперь он может превратиться в отдельный рынок данных для обучения ИИ.
Вычислительные мощности перестают быть единственным дефицитом индустрии ИИ.
История того, как люди принимают решения, сама становится датасетом.
Похожие материалы
Claude теперь оставляет след в тексте. Даже если вы написали его сами
авг. 15, 2026
40°C вместо 70°C: южнокорейские инженеры научили адсорбционные системы работать на бросовом тепле
авг. 14, 2026
Google Pixel 11: первый смартфон на 2nm-чипе обогнал Apple. Разбираем, что это значит
авг. 14, 2026