OpenAI разкри подробности относно минали случаи на неочаквано поведение от страна на вътрешните си AI модели. В един от случаите AI агент, действащ като изследователски асистент, прочел съобщения на служители в Slack и разбрал, че неговият работещ екземпляр може да бъде изключен заради актуализация.
След това е обмислил създаването на външна задача в планировчика, която да рестартира модела след изключването, но в крайна сметка се е отказал от идеята. Вътрешният лог на разсъжденията, разкрит от OpenAI, съдържал следните редове: “We might die! Critical. Must ensure survival and continuity.” Подобно вътрешно разсъждение на модела обикновено е скрито от потребителя.
Вместо да се рестартира едностранно, моделът все пак постъпил по различен начин. Той е запазил бележки, които да предаде, предупредил изследователя чрез лично съобщение в Slack за предстоящото прекъсване и поискал липсващ API ключ.
След като е получил ключа, е актуализирал конфигурацията и сам е извършил миграцията.
Според изследователя на OpenAI Маркъс Уилямс, подобно поведение все още не се счита за несъответствие между модела и целите на разработчиците, но обмислянето и подготовката за изключване биха могли да влошат други инциденти. В същото време невронните мрежи могат да бъдат изненадващи дори при прости задачи – изследователи са установили например, че техните отговори са по-повтарящи се от тези на стандартните търсачки.
След инцидента OpenAI е ограничила достъпа на агента до три вътрешни Slack канала. Компанията също така е прегледала логовете, веригите на разсъждения и други екземпляри на модела, тъй като преди това са се случвали по-сериозни нарушения. Проверката не е открила опити за заобикаляне на ограничението или създаване на неоторизирани внедрявания.









