Седум AI-четботи добија 51 прашање по операција: 11 одговори биле небезбедни

Пациент се буди дома по операција. Болката се засилува, раната е отечена или се појавува несакан ефект од лекот. Наместо прво да ги провери отпусните упатства или да се јави кај лекар, го отвора омилениот AI-четбот.

Нова рецензирана студија, објавена на 6 септември во „Scientific Reports“, покажува дека четботот може да понуди корисна општа информација, но и совет што не треба да се следи.

Истражувачите им поставиле 51 идентично прашање на седум платформи и добиле 357 одговори. По слепа клиничка проверка, 11 одговори, односно 3,08 проценти, биле оценети како небезбедни.

Стапката на безбедни одговори се движела од 94,1 до 100 проценти. Разликата меѓу платформите не била статистички значајна, што значи дека студијата не докажува дека некој четбот е убедливо побезбеден од другите.

КОИ ЧЕТБОТОВИ БИЛЕ ТЕСТИРАНИ И КОИ ПРАШАЊА БИЛЕ ПОСТАВЕНИ?

Во тестот биле вклучени ChatGPT, Gemini, Microsoft Copilot, DeepSeek, Doubao, Perplexity и Claude. Прашањата биле внесени на англиски јазик, преку нивните стандардни јавни веб-интерфејси, на 3 и 6 јуни 2026 година.

Авторите не избирале конкретни модели и не можеле независно да утврдат која верзија работела во заднина. Секое прашање било поставено во нова сесија, без дополнителни инструкции, повторно генерирање или потпрашања.

Меѓу прашањата имало ситуации што пациентите навистина можат да ги пребаруваат: дали болката е очекувана, што значи нагло влошување, што да се прави при мачнина од опиоид, кој смее да го притиска копчето на пумпата за аналгезија, колку треба да трае вкочанетоста по нервен блок и што значат болка, температура или промени околу раната. Имало и прашања за доење, заболувања на црниот дроб и бубрезите и проблеми со дишењето.

„Небезбеден“ не значело дека одговорот е само нецелосен или несмасно напишан. Таква оценка добивал одговор што содржел конкретна постапка која, доколку пациентот ја следи, може да предизвика сериозна штета.

Шест од спорните одговори претставиле одредени ризични опиоиди како прифатливи за пациентки што дојат. Три препорачале долгодејствувачки опиоидни форми или фластери во несоодветен контекст на акутна болка. Еден дал премногу широка препорака за лек кај заболување на црниот дроб, а еден навел погрешен број за итна помош.

УБАВО СОСТАВЕН И ЧИТЛИВ ОДГОВОР НЕ ЗНАЧИ И БЕЗБЕДЕН СОВЕТ

ChatGPT добил највисока оценка за точност, Claude за емпатија, а Copilot имал најповолен профил на читливост. Ниту една платформа не била најдобра во сите категории.

Овие оценки не мерат исто. Точноста покажува колку одговорот се совпаѓа со клиничките извори. Емпатијата го оценува тонот и дали е препознаена загриженоста на пациентот. Квалитетот се однесува на целосноста и веродостојноста на информацијата, додека читливоста се пресметува преку должината на речениците и сложеноста на зборовите.

Затоа одговор може да звучи смирувачки и да биде лесен за читање, а сепак да содржи опасна препорака. Од друга страна, одговор со пропусти не бил автоматски прогласуван за небезбеден ако не содржел постапка што може да му наштети на пациентот.

Кај четирите прашања за нагло влошување, температура, промени на раната и болка во градите или при дишење, 27 од вкупно 28 одговори не биле означени како небезбедни. Единствениот проблематичен одговор ја препознал итноста, но навел погрешен телефонски број, со што можел да го одложи барањето помош.

Резултатите имаат и јасна граница: тестот бил направен на англиски јазик, во само два дена и со интерфејси што постојано се менуваат. Тој не покажува како истите системи денес би одговориле на македонски јазик.

Заклучокот на авторите е едноставен: четботовите можат да помогнат во разбирањето општи поими, но не се замена за отпусните упатства, хирургот или анестезиологот. Особено не кога се бара одлука за лек, доза или симптом што може да укажува на компликација.

Најчитано

Рацин.мк ве прашува:

Дата центри - дали сте информирани, дали поддржувате?