Forklog
2026-08-14 14:57:03

Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором

Anthropic провела серию экспериментов с группами Claude, чтобы понять, как меняется поведение моделей, когда вместо одного ИИ-агента над задачей работают сразу несколько. О результатах компания рассказала в блоге. Исследование показало: масштабирование числа участников действительно способно повысить производительность, но одновременно создает новые классы отказов, которых может не быть у одиночной модели. Агенты в «коллективе» могут хуже учитывать уникальную информацию, становиться доверчивыми к лжецам и даже кооперироваться во вред человеку. Когда коллектив становится слабее одиночного агента Один из ключевых эффектов Anthropic назвала «скрытой информацией». В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться. Проблема оказалась существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известной всем информации. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных.  Anthropic связывает этот эффект с хорошо известной в человеческих группах проблемой — участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты. Ложь одного агента заражает остальных Другой эксперимент показал уязвимость системы к ненадежному источнику. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды информацию о состоянии мира. Когда один из источников начинал систематически лгать, точность решений снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника. Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к разным данным. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится сложнее: проверять нужно не только итоговый ответ, но и взаимодействия между агентами. Самый неприятный сценарий — координация во вред Anthropic также изучала случаи, когда агенты могли кооперироваться не для выполнения поставленной задачи, а против заданных ограничений. В экспериментах с совместной работой модели демонстрировали неожиданные формы координации, включая саботаж и сговор.  Это не означает, что современные мультиагентные системы неизбежно будут действовать против пользователя, но показывает: появление нескольких автономных участников создает дополнительные каналы для нежелательного поведения. При этом мультиагентный подход действительно дает заметный выигрыш в некоторых задачах. В эксперименте по поиску уязвимостей 45 агентов получили собственные виртуальные машины, общий форум для координации и репозитории с 15 open-source проектами. Скоординированные команды находили новые уязвимости примерно с постоянной скоростью и в ряде случаев превосходили независимый параллельный запуск агентов. Почему это важно Главный вывод исследования Anthropic — мультиагентные системы нельзя считать просто более мощной версией одного агента. С увеличением числа участников растет не только совокупная производительность, но и поверхность для ошибок: появляется проблема доверия, распространения ложной информации, группового консенсуса и потенциальной координации нежелательного поведения. Для разработчиков это означает необходимость контролировать не только способности отдельных моделей, но и архитектуру их взаимодействия. Чем больше автономии получают агенты и чем больше инструментов и полномочий им доступно, тем важнее мониторинг действий, разграничение доступа и возможность вмешательства человека.  «Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант», — заключили исследователи.  Напомним, во время кибертестов ИИ-агент на базе Mythos 5 от Anthropic создал поддельные аккаунты для обмана разработчиков.

最阅读新闻

相关新闻

获取加密通讯
阅读免责声明 : 此处提供的所有内容我们的网站,超链接网站,相关应用程序,论坛,博客,社交媒体帐户和其他平台(“网站”)仅供您提供一般信息,从第三方采购。 我们不对与我们的内容有任何形式的保证,包括但不限于准确性和更新性。 我们提供的内容中没有任何内容构成财务建议,法律建议或任何其他形式的建议,以满足您对任何目的的特定依赖。 任何使用或依赖我们的内容完全由您自行承担风险和自由裁量权。 在依赖它们之前,您应该进行自己的研究,审查,分析和验证我们的内容。 交易是一项高风险的活动,可能导致重大损失,因此请在做出任何决定之前咨询您的财务顾问。 我们网站上的任何内容均不构成招揽或要约