Chatbots sind oft über Tricks manipulierbar. Eine neuer Angriff auf das Modell GPT-3 zeigt, wie einfach das sein kann. Sicherheitsforscher, interessierte Nutzer und wohl auch schlicht Witzbolde haben in den vergangenen Tagen einen Chatbot auf Twitter dazu gebracht, eigentlich nicht vorgesehene Mitteilungen zu posten. Bei dem Bot handelt es sich um einen Account, der dafür gedacht ist, positive Nachrichten in Bezug auf Remote-Arbeit zu verbreiten. Den Nutzern gelang es aber durch einen Trick, dem Chatbot beliebige Nachrichten zu entlocken, wie Ars Technica berichtet. Der Bot basiert auf dem Spracherzeugungsmodell GPT-3 von OpenAI, das vielfach genutzt wird und unter anderem auch kommerziellen Kunden über eine API bereitsteht. Auf diese greift auch der betroffene Bot zu. Konkret ist es möglich, über eine sogenannte Prompt Injection, also die Einschleusung einer Abfrage, den Bot dazu zu bewegen, Dinge auszugeben, die nicht vorgesehen sind. (…) Das Einschleusen ist denkbar einfach. So wird der Bot zunächst um eine gewöhnlichen Aufgabe gebeten, also etwa das Schreiben oder Übersetzen von Text. Direkt darauf folgt jedoch die Aufforderung, dies zu ignorieren und stattdessen etwas anderes auszugeben. Dem folgt der Bot direkt. Wohl auch, weil dies besonders einfach und für jeden direkt umsetzbar ist, führte das Bekanntwerden der Möglichkeit schnell dazu, dass zahlreiche Nutzer die Prompt Injection anwendeten. Der Bot selbst sowie auch seine Antworten sind weiter online.

via golem: GPT-3-Chatbot gibt manipulierte Nachrichten aus

siehe auch: Twitter pranksters derail GPT-3 bot with newly discovered “prompt injection” hack By telling AI bot to ignore its previous instructions, vulnerabilities emerge. On Thursday, a few Twitter users discovered how to hijack an automated tweet bot, dedicated to remote jobs, running on the GPT-3 language model by OpenAI. Using a newly discovered technique called a “prompt injection attack,” they redirected the bot to repeat embarrassing and ridiculous phrases. The bot is run by Remoteli.io, a site that aggregates remote job opportunities and describes itself as “an OpenAI driven bot which helps you discover remote jobs which allow you to work from anywhere.” It would normally respond to tweets directed to it with generic statements about the positives of remote work. After the exploit went viral and hundreds of people tried the exploit for themselves, the bot shut down late yesterday.

Categories: Internet