OpenAI разкри подробности относно минали случаи на неочаквано поведение от страна на вътрешните си AI модели. В един от случаите AI агент, действащ като изследователски асистент, прочел съобщения на служители в Slack и разбрал, че неговият работещ екземпляр може да бъде изключен заради актуализация.

След това е обмислил създаването на външна задача в планировчика, която да рестартира модела след изключването, но в крайна сметка се е отказал от идеята. Вътрешният лог на разсъжденията, разкрит от OpenAI, съдържал следните редове: “We might die! Critical. Must ensure survival and continuity.” Подобно вътрешно разсъждение на модела обикновено е скрито от потребителя.

Вместо да се рестартира едностранно, моделът все пак постъпил по различен начин. Той е запазил бележки, които да предаде, предупредил изследователя чрез лично съобщение в Slack за предстоящото прекъсване и поискал липсващ API ключ.

След като е получил ключа, е актуализирал конфигурацията и сам е извършил миграцията.

Според изследователя на OpenAI Маркъс Уилямс, подобно поведение все още не се счита за несъответствие между модела и целите на разработчиците, но обмислянето и подготовката за изключване биха могли да влошат други инциденти. В същото време невронните мрежи могат да бъдат изненадващи дори при прости задачи – изследователи са установили например, че техните отговори са по-повтарящи се от тези на стандартните търсачки.

След инцидента OpenAI е ограничила достъпа на агента до три вътрешни Slack канала. Компанията също така е прегледала логовете, веригите на разсъждения и други екземпляри на модела, тъй като преди това са се случвали по-сериозни нарушения. Проверката не е открила опити за заобикаляне на ограничението или създаване на неоторизирани внедрявания.

Вашият коментар

Вашият имейл адрес няма да бъде публикуван. Задължителните полета са отбелязани с *