06.10.2026 Экспертиза, Искусственный интеллектНа первый взгляд может показаться, что обучать ИИ на открытых данных — беспроигрышный вариант. В самом деле — тексты и изображения лежат в свободном доступе, то есть и результат принадлежит тому, кто обучил модель. На практике за этой простотой скрывается сразу несколько правовых ловушек. Рассмотрим, какие риски с ними связаны и почему общедоступное не равно ничье. Ловушка непрозрачности Прежде чем рассуждать о том, кто и как отвечает за обучение ИИ на чужих материалах, стоит разобраться с одним техническим обстоятельством — именно оно во многом определяет, почему тема вообще считается такой запутанной. Речь о принципиальной непрозрачности готовой модели. Когда обучение завершено, она представляет собой терабайты числовых коэффициентов, и ни один инструмент не позволяет вскрыть их и доказать, что вот этот конкретный роман или вот эта фотография участвовали в тренировке. Исходный текст не лежит внутри весов в виде, который можно предъявить как улику, — он растворен в статистике, и строго, математически подтвердить факт его использования после обучения невозможно. Отсюда рождается соблазнительный, но ошибочный вывод: раз доказать присутствие конкретного произведения в обученной модели нельзя, то и спрашивать не с кого. На деле непрозрачность модели вовсе не оставляет авторов беззащитными — она лишь смещает точку, в которой закон способен вмешаться. Проверить веса действительно не выйдет, но у любого обучения есть два наблюдаемых момента: то, что подается на вход, и то, что ...
читать далее.