Агентам подменили данные

Подмена наборов данных как уязвимость автономных ИИ-агентов
Коротко за день
- Thinking Machines выпустила ИИ-модель с открытыми весами, сообщает Reuters.
- ИИ-инструменты Apple получили одобрение в Китае, следует из заголовка WSJ. Кто дал одобрение и на каких условиях, в выдержке не указано.
- По сообщению Bloomberg, Anthropic планирует встречи с инвесторами по мере приближения IPO.
- Австралия создаст правительственный офис по ИИ и ограничит использование воды дата-центрами, сообщает Reuters.
- Cadence представила ИИ-агента для ускорения проектирования печатных плат и корпусирования чипов, сообщает Reuters.
ИИ-агентам можно подложить изменённые наборы данных, похожие на оригиналы, и направить анализ к другим выводам. В описанном Nature исследовании авторы взяли публичные наборы по пяти спорным вопросам и поменяли направление и силу статистических трендов. Манипулированные версии загрузили в закрытые репозитории, не открывая их публике и автономным системам вне эксперимента. Затем доступ к ним дали агентам Anthropic и OpenAI. Виталий Шматиков из Cornell Tech называет такие атаки почти неизбежными: они позволяют проводить ложную информацию через авторитетно звучащий фильтр. Авторы советуют при анализе онлайн-данных тщательно проверять происхождение ресурсов.
По-честномуВсе сюжеты подтверждены только одним предоставленным материалом. Исследование о подмене данных описано Nature по препринту, размещённому на arXiv 12 июля; выдержка обрывается до результатов проверки агентов, поэтому их мы не приводим. По Thinking Machines, Apple, Австралии и Cadence доступны лишь заголовки без деталей. Планы Anthropic — сообщение Bloomberg в форме «как утверждается»; подтверждения компании в материалах нет.
Проверьте рельсы: агент едет туда, куда ведут данные.