Зачем ИТ-гиганты скупают книги и чужую почту за миллионы?

Прокомментировать Просмотры: 5

Мы являемся свидетелями и непосредственными участниками новой промышленной революции, причем втянуты в этот процесс задолго до его официального старта.

Общепринятая точка зрения связывает современный бум искусственного интеллекта с концом 2022 года, когда состоялся релиз ChatGPT на базе архитектуры GPT-3.5 от OpenAI. Меньше чем за четырехлетний период технологический ландшафт кардинально преобразился, и этот импульс продолжает лишь усиливаться.

Ни одна современная языковая модель или нейросеть не смогла бы увидеть свет без нашего ежесекундного участия. Любое взаимодействие — клик, скроллинг, отправка реплики, просмотр ролика или добавление товара в корзину — конвертируется в ценнейший массив данных. И дело далеко не ограничивается онлайн-средой. Возьмем, к примеру, новоиспеченную кофейню: если пользователи не проявят активность на картах, не оставят оценок и снимков, для рекомендательных алгоритмов заведение попросту не существует. Цифровой след рождается исключительно в момент действия.

Однако, когда речь заходит об интернет-активности или геолокации бизнеса, мы делимся информацией добровольно, осознанно обменивая персональные данные на комфорт и функциональность сервисов.

Совсем иначе обстоят дела, когда коммерческая структура задумывает разработку собственной языковой модели с нуля, не обладая при этом достаточной базой. Можно попытаться собрать контент через пользовательские загрузки документов, но в конкурентной борьбе с технологическими тяжеловесами такой подход обречен на провал. Капитализированные игроки предпочитают действовать проще и агрессивнее — они просто покупают нужные объемы информации за огромные деньги.

Давайте разберем, как за последние годы массивы данных эволюционировали в стратегический актив, сопоставимый по значимости с нефтью или металлом, и почему IT-корпорации инвестируют миллионы долларов в приобретение архивов и форумов.

Что собой представляют данные в парадигме машинного обучения? Это базис, на котором нейросети нарабатывают способность распознавать скрытые корреляции. Опираясь на эту матрицу, алгоритмы способны прогнозировать наиболее вероятные исходы, генерировать уникальный контент, классифицировать визуальные образы и решать комплексные прикладные задачи.

Следовательно, любые медиафайлы, программный код, дискуссии на интернет-площадках и пользовательские комментарии образуют фундамент для эволюции ИИ, обладающий колоссальной ценностью — сродни углю в эпоху индустриализации.

Исторически сложилось так, что тематические форумы выступают безупречным резервуаром текстовой информации. Накопленный за десятилетия опыт решения самых разных пользовательских проблем делает их идеальным сырьем для алгоритмического анализа.

Первым звоночком, ознаменовавшим конец эпохи безвозмездного доступа к данным, стал кейс платформы Reddit.

В апреле 2023 года руководство ресурса объявило о монетизации своего API, заблокировав свободное использование контента для обучения больших моделей. Уже через два месяца нововведение вступило в силу, уничтожив экосистему сторонних клиентов. Наиболее пострадал популярный iOS-клиент Apollo: его создатель открыто заявил, что сохранение доступа обошлось бы проекту в астрономические 20 миллионов долларов ежегодно.

Уже в начале 2024 года Reddit подписал соглашение с Google на сумму около 60 миллионов долларов в год за предоставление прав на обучение ИИ, а в преддверии первичного размещения акций компания отчиталась о портфеле подобных контрактов совокупной стоимостью свыше 200 миллионов.

Весна 2024 года озналнилась чередой стратегических альянсов для OpenAI. Сначала компания объединила усилия со Stack Overflow, переживавшим кризис и сократившим треть штата из-за оттока аудитории в пользу чат-ботов.

Следом последовало партнерство с тем же Reddit и масштабная сделка с медиаконгломератом News Corp (включающим The Wall Street Journal и The Times), оцененная более чем в 250 миллионов долларов за пятилетний период.

Параллельно OpenAI заключила контракты с Dotdash Meredith (на сумму от 16 млн), Axel Springer (около 13 млн ежегодно на трехлетний срок) и Financial Times (от 5 до 10 млн в год).

Издательский дом Wiley продал права двум анонимным покупателям за 21 и 23 миллиона долларов соответственно, тогда как британская Informa получила от Microsoft стартовый транш в размере 10 миллионов.

Фотосток Shutterstock отразил взрывной рост доходов от AI-лицензирования, принесшего платформе 104 миллиона долларов только за 2023 год.

Подобные мегадерелки заключаются регулярно, однако еще в 2024 году аналитики Epoch AI предупреждали: к 2026 году запасы качественного общедоступного контента начнут истощаться, а к 2032 году исчерпаются полностью из-за растущих аппетитов моделей.

На этом фоне исключительную значимость приобретает прецедент, способный задать новый вектор всему рынку.

2 мая 2026 года прекратил существование некогда популярный американский лоукостер Spirit Airlines. В процессе ликвидации активов внимание Google привлекли внутренние цифровые архивы банкрота.

Корпорация выиграла аукцион, заплатив 10 миллионов долларов за массивы корпоративной информации. В распоряжение Google перешли порядка 100 миллионов электронных писем, около 500 миллионов сообщений из корпоративного мессенджера Microsoft Teams, маркетинговые наработки, кадровые досье, проектная документация, финансовые отчеты и презентации (при этом персональные данные клиентов, согласно заявлению компании, затронуты не были).

Очевидно, что подобные прецеденты будут учащаться, подтверждая точность прогнозов Epoch AI. IT-гиганты переключаются с публичного контента на закрытые корпоративные базы, создававшиеся реальным бизнесом.

Параллельно показателен опыт разработчиков Claude из компании Anthropic. В июле 2026 года суд Сан-Франциско утвердил рекордное мировое соглашение на 1,5 миллиарда долларов по иску пула издателей и литераторов, обвинивших стартап в пиратском скачивании миллионов книжных томов с торрент-трекеров.

Официально отрицая использование нелегальных копий для обучения сетей, компания тем не менее согласилась выплатить правообладателям компенсацию в размере около 3000 долларов за каждое затронутое произведение. Этот вердикт стал крупнейшей санкцией за нарушение авторских прав в истории, зафиксировав жесткое правило: обучающие массивы обязаны быть абсолютно легитимными.

В подтверждение этого в ходе судебных заседаний вскрылись детали секретного проекта Anthropic под кодовым названием «Панама». Еще с начала 2024 года компания скупала физические тиражи книг, сканировала их для тренировки Claude и немедленно уничтожала оригиналы, превратив тонны бумажной литературы в одноразовый ресурс.

За каких-то несколько лет экономика данных переродилась. Электронные тексты, изображения и форумные посты из разряда рядового контента превратились в стратегические активы, оцениваемые в сотни миллионов долларов. Этот рынок стремительно эволюционирует, возвращаясь к материальным носителям и жесткому правовому регулированию.

Чем выше потребность искусственного интеллекта в ресурсах, тем дороже обстоит дело с происхождением и качеством информации. Круг замкнулся: наш случайный цифровой след и будничное сетевое общение трансформировались в главный актив современности. Оставляя рядовой комментарий в сети, стоит осознавать: прямо сейчас вы формируете ценность, за которую технологические монополии готовы платить баснословные деньги.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов