Research on Models Engaging in Genie-Like Behavior
-
New paper: “Self-Jailbreaking: Language Models Can Reason Themselves Out of
Safety Alignment After Benign Reasoning Training.”
*Abstract:* We discover a ...
7 hours ago








No comments:
Post a Comment