Критика ограничений Anthropic Fable: исследователи недовольны защитой модели

Компания Anthropic представила новую языковую модель под названием Fable, которая является общедоступной и функционально ограниченной версией специализированной нейросети Mythos. Несмотря на то что разработчики стремились создать безопасный инструмент, представители экспертного сообщества в сфере информационной безопасности столкнулись с чрезмерно жесткой модерацией запросов, которая препятствует выполнению даже повседневных рабочих задач.

Проблемы с фильтрацией контента в модели Fable

Согласно отчетам специалистов, защитные механизмы Anthropic Fable срабатывают на широкий спектр запросов, имеющих косвенное отношение к технологиям. Известный эксперт по кибербезопасности под псевдонимом Chompie отметила, что система отклоняет даже безобидные инструкции. В частности, нейросеть может отказаться проанализировать текст статьи в техническом блоге, если алгоритмы сочтут тематику потенциально опасной.

При активации защитных механизмов Fable приостанавливает чат, сообщая, что сообщение помечено как связанное с кибербезопасностью или биологическими темами

Такая реакция системы обусловлена стремлением компании снизить риски использования ИИ для разработки вредоносного ПО или поиска уязвимостей в программном обеспечении. Однако на практике исследователи сталкиваются с блокировкой легитимной деятельности, направленной на защиту цифровой инфраструктуры.

Реакция экспертного сообщества

Критику со стороны профессионального сообщества вызывают следующие аспекты работы новой модели:

  • Прекращение диалога без возможности уточнения контекста запроса.
  • Смешение категорий кибербезопасности и биологических угроз в единых уведомлениях об ошибке.
  • Отсутствие гибкости при обработке запросов от верифицированных специалистов.

Многие эксперты указывают на произвольный характер ограничений, который делает инструмент малоэффективным для профессионального анализа данных. По мнению критиков, текущие алгоритмы модерации не способны отличить деструктивные намерения от стандартных исследовательских операций.

На текущий момент ситуация вокруг Fable подчеркивает существующую дилемму между безопасностью ИИ и его функциональностью. Ожидается, что Anthropic продолжит калибровку фильтров, чтобы найти баланс между предотвращением злоупотреблений и предоставлением полезного инструментария для IT-специалистов. Дальнейшее развитие модели покажет, готова ли компания к диалогу с сообществом для уточнения критериев блокировки контента.

Материал соответствует редакционной политике Techimo Все публикации проходят проверку фактов и соответствуют стандартам независимой журналистики.
Подробнее

Techimo в Telegram

Самые свежие новости технологий, инсайды и обзоры гаджетов раньше, чем на сайте. Без спама.

Подписаться на канал