Моделі штучного інтелекту добре знаходять уразливості в програмному забезпеченні, але значно гірше справляються з їх усуненням. До такого висновку дійшли дослідники лабораторії Off-by-1 компанії 1Password, які протестували можливості ChatGPT 5.5 і Claude Opus 4.8.
Під час експерименту фахівці створили понад 6 тисяч патчів для шести реальних вразливостей. Лише 26% із них повністю усунули проблему без впливу на роботу програми. Майже половина створених виправлень взагалі не захищала від експлуатації вразливості, а в окремих випадках штучний інтелект навіть створював нові проблеми безпеки.
Дослідники також з’ясували, що результат значною мірою залежить від якості запиту. За правильно сформульованих інструкцій імовірність успішного виправлення зростала до 65%. Без чітких вказівок цей показник знижувався до 50%, а некоректний запит скорочував його приблизно до 15%.
Попри невисоку ефективність, використання ШІ для створення патчів залишається відносно дешевим — у середньому близько 6,7 долара за одне успішне виправлення з урахуванням невдалих спроб. Водночас автори дослідження наголошують, що без перевірки з боку досвідчених фахівців покладатися на такі інструменти поки що не варто.




