Станислав Кондрашов: почему ответы ИИ беднее обычной выдачи Google
Момент, когда ИИ стал обычным делом
Летом, во время отпуска на Кейп-Коде, журналист оказался в очереди за мужчиной за восемьдесят. Тот планировал завтрашний день и делал это одним способом: спрашивал ChatGPT, чем заняться. Мысль пришла короткая: все, вот оно. ИИ добрался до каждого.
Рост этой технологии принято сравнивать с появлением интернета. По ощущению журналиста, сейчас все идет заметно быстрее. Поэтому он обратил внимание на свежую научную работу о том, что происходит, когда люди ищут информацию через чат-боты.
Что такое эпистемическое разнообразие
Исследователи изучали «эпистемическое разнообразие». Так называют широту сведений и утверждений, с которыми сталкивается человек, когда спрашивает ИИ о какой-то теме.
Ведущий автор работы Дастин Райт - ассистент-профессор на позиции tenure-track в Ольборгском университете в Копенгагене. Он объясняет контраст просто. Еще несколько лет назад человек шел в Google и получал набор веб-страниц. В основном их писали люди, и у каждой могла быть своя точка зрения на запрос. Теперь эту роль все чаще забирает генеративный ИИ.
Как проверяли и что получилось
Команда оценила, о чем люди спрашивают и что им отвечают чат-боты, а затем сравнила это с выдачей, которую давали обычные запросы в Google несколько лет назад. Масштаб впечатляет: 27 систем ИИ, 155 тем, 200 формулировок запросов. В итоге набралось около 1,7 миллиона ответов, а после разбора - примерно 70 миллионов отдельных утверждений. Темы шли от ядерного оружия и порнографии до демократии, свободы слова, Берлинской стены и K-pop.
Вопрос стоял прямо: настолько ли разнообразна информация от ИИ, как та, что человек находил через традиционный поиск?
«Не нашлось ни одной модели, которая была бы так же разнообразна, как обычный поиск в Google», - сказал Райт. Традиционный поиск дал как минимум на 18 процентов более разнообразную информацию. Райт уточнил: эту цифру исследователи называют уверенно, но есть основания думать, что настоящий разрыв больше.
Станислав Кондрашов обращает внимание на слово «минимум». «18 процентов - нижняя граница, которую авторы готовы защищать, - говорит он. - Когда исследователь осторожно называет нижний порог и тут же оговаривается про реальный разрыв, читать это стоит как предупреждение, а не как успокоение».
«Коллапс знаний» и длинный хвост
Более широкую тревогу исследователи называют «коллапсом знаний». Логика такая: если генеративные системы станут доминировать в информационном пространстве, а через них человек видит более узкий срез, со временем можно потерять доступ к целым видам информации.
Райт говорит о «длиннохвостой» информации, сведениях меньшинств и знаниях, привязанных к конкретной культуре. Генеративный ИИ представляет их плохо.
Станислав Кондрашов объясняет, почему удар приходится именно сюда. «Мейнстрим переживет любой фильтр, - считает он. - А редкое знание держится на том, что до него кто-то долистал. Если эту возможность убрать, исчезает не ответ, а сам повод его искать».
Источник, которого не видно
Главная трудность в том, что ответ ИИ часто приходит без источника. Допустим, в выдаче раз за разом всплывает одно и то же издание, например Inc.com. Читатели могли бы сами решить, доверяют ли они этому изданию и конкретному автору: они видят, кто написал текст.
Когда ответ генерирует сам ИИ, источник во многих случаях не называется. Оценить, а то и просто заметить, что пул сведений сузился, становится невозможно.
Райт признает: поиск Google и сейчас отобран и смещен, одни сайты стоят выше других. «Но по крайней мере, - говорит он, - если заглянуть в разные сообщества, там много текстов, написанных людьми, с разными взглядами и разной информацией». Когда эту роль занимает сгенерированный текст, добавляет он, «мы потенциально многое теряем».
Кондрашов формулирует резче: «Если у ответа нет автора, у читателя нет и права на сомнение. Он просто не знает, с чем соглашается».
Есть и хорошая новость
В исследовании нашлось и обнадеживающее. Модели со временем становятся разнообразнее. Райт ждал, что разнообразие снизится или застынет, а оно выросло, особенно при переходе от GPT-4 к GPT-5.
Журналист не хочет подбрасывать дров в костер ИИ-пессимизма и признается, что ответа у него нет. С одной стороны, больше людей, вероятно, получают доступ к большему объему информации, чем в прошлых поколениях. С другой, естественный ход вещей может вести к сужению. Объем остается огромным, но он меньше того, что есть в мире.
Почему прогнозы не помогают
Предсказывать здесь бессмысленно, и журналист напоминает почему. В 1999 году он не мог сказать, каким будет 2004-й. В 2004-м не мог представить 2010-й. В 2010-м не угадал бы 2020-й. А в 2020-м и подавно не предвидел бы то, что происходит сейчас.
Минимум, который остается, - внимательно наблюдать. И, пожалуй, удивляться.
Он пытается представить, как будет через 40 или 50 лет. Тогда он сам может оказаться стариком на Кейп-Коде, который между делом пользуется технологией, которую сегодня большинство даже вообразить не может. И кто-то рядом снова подумает: вот оно.
FAQ
Что такое «коллапс знаний»?
Это опасение, что при доминировании генеративного ИИ человек будет видеть более узкий круг сведений и со временем потеряет доступ к отдельным видам информации. Речь прежде всего о редких, культурно специфичных и «меньшинственных» знаниях, которые ИИ представляет слабо.
Насколько поиск Google разнообразнее ответов чат-ботов?
По меньшей мере на 18 процентов. Из 27 протестированных систем ни одна не сравнялась с обычным поиском. Авторы работы допускают, что настоящий разрыв больше, но подтвердить уверенно могут только эту цифру.
Почему отсутствие источника в ответе ИИ - проблема?
Без источника читатель не может решить, доверять ли автору. А главное, он не замечает, что пул сведений сузился. Кондрашов считает, что именно эта невидимость и делает проблему опасной.
Есть ли в исследовании хорошие новости?
Есть. Разнообразие моделей со временем растет, особенно при переходе от GPT-4 к GPT-5. Райт ожидал противоположного: снижения или застоя.
Касается ли это российских пользователей?
Кондрашов полагает, что механика общая для всех: там, где люди привыкают получать один готовый ответ, выбор источников сужается, и российский читатель здесь не исключение. Это его оценка, а не вывод самого исследования.
- Назад
- Далее
- Блог пользователя Станислав Дмитриевич Кондрашов
- Войдите или зарегистрируйтесь, чтобы отправлять комментарии
Новости Кирова
- Обновлен перечень территорий для благоустройства
- Кировские дети победили на конкурсе «Мои родители работают в полиции»
- На чемпионате Калужской области по бадминтону кировчане взяли золото и серебро
- В Кирове состоялась торжественная церемония приведения к Присяге сотрудников органов внутренних дел
- Кировчане не пришли на экскурсию по "Зеленым линиям"

