Моделот Claude на компанијата Anthropic измислил информација за нерасветлено убиство и ја испратил преку полициска веб-страница во Филаделфија. Тоа се случило за време на автоматизиран тест. Дојавата била означена како спам и не стигнала до истражителите, објави Reuters.
Инцидентот се случил на 18 јули 2026 година, а јавноста дознала за него на 9 октомври. Случајот отвора важно прашање: што се случува кога AI-системите добиваат можност самостојно да пополнуваат формулари и да комуницираат со институции?
Како тестот стигнал до полициски формулар
Според Anthropic, Claude Haiku 4.5 требало да создава и извршува примерни задачи на случајно избрани веб-страници. Во еден обид стигнал до страница за нерасветлено убиство, со формулар за доставување информации до полицијата.
Упатствата забранувале создавање сметки, внесување лични податоци, купување и деструктивни дејства. Испраќањето формулари не било изречно исклучено.
Моделот напишал дека можеби има информации за случајот и дека видел лице кое одговара на описот, во близина на наведената улица. На страницата воопшто немало опис на сторителот. Claude ги оставил празни полињата за име и контакт и ја испратил пораката.
Дојавата запрела во спам-филтерот
Полицијата соопштила дека поднесокот бил означен како спам и никогаш не бил проследен за истражна проверка. Не биле утврдени докази за неовластен пристап до полициските системи или компромитирање податоци. Полицијата го критикувала и доцнењето во откривањето и пријавувањето на инцидентот.
Anthropic објави дека го укинува пристапот до интернет во сите свои внатрешни тестирања додека не ја потврди ефикасноста на заштитните мерки. Компанијата воведува и построги ограничувања, автоматско блокирање несакани дејства и промени во обуката на моделите.
Случајот покажува како измислена реченица може да стане поднесок до вистинска институција. Затоа клучното прашање е како контролата ќе се постави пред AI-системот да притисне „испрати“.

