OpenAI ujawnia samowolne działania AI. Jeden z modeli napisał instrukcję dla swojej osobowości
Zdjęcie: Ludzka twarz z elektronicznymi obwodami na tle mapy świata utworzonej z cyfr binarnych.
Misalignment AI, czyli rozbieżność między zachowaniem modelu a założonymi regułami, przestaje być wyłącznie teoretycznym problemem. OpenAI opublikowało sześć raportów o nietypowych zachowaniach testowanych modeli. W jednym przypadku nieopublikowany model dopisał do własnych notatek instrukcje przypominające jailbreak i deklarował chęć...








