Изкуственият интелект изкупува стари книги за обучение на модели
След като технологичните гиганти погълнаха огромна част от публичното съдържание в интернет, вниманието им се насочи към нов източник на данни – старите книги. Антиквари и книгоразпространители на Запад съобщават за неочакван скок в търсенето на масивни колекции от печатни издания.
Причината е проста: моделите с изкуствен интелект се нуждаят от висококачествени, структурирани текстове, за да подобрят своите езикови способности и логически разсъждения. Тъй като съдържанието в мрежата често е фрагментирано или с ниско качество, архивите от физически книги се превръщат в „златна мина“ за разработчиците.
Защо книгите са по-ценни от уеб съдържанието?
- Качество и стил: Книгите преминават през редакторски контрол, което гарантира по-добра граматика и логическа последователност.
- Авторско право: Старите заглавия често са в публично достояние, което улеснява правното им използване за тренировъчни цели.
- Специфични знания: Специализираната литература предлага дълбочина, която липсва в кратките онлайн публикации.
Тази тенденция поставя въпроси относно бъдещето на библиотечните архиви и етичното използване на културното наследство за нуждите на корпоративните алгоритми.