Met deze cyberaanval kunnen hackers AI-modellen compromitteren door slechts één letter te wijzigen.

Samenvatting:

  • Onderzoekers van HiddenLayer hebben een nieuwe aanval op grote taalmodellen (LLM's) ontwikkeld, genaamd TokenBreaker.
  • Door slechts één teken toe te voegen of te wijzigen, kunnen ze een aantal beveiligingsmechanismen omzeilen.
  • Eenvoudige grote taalmodellen (LLM's) kunnen de bedoeling van de aanval nog steeds begrijpen.

Beveiligingsonderzoekers hebben een manier ontdekt om de ingebouwde beschermingsmechanismen in sommige Grote taalmodellen (LLM) en ervoor zorgen dat er op kwaadaardige claims wordt gereageerd.

Kieran Evans, Casimir Schulz en Kenneth Young van HiddenLayer hebben een uitgebreid rapport gepubliceerd over een nieuwe aanvalstechniek die zij TokenBreak noemen. Deze aanvalstechniek richt zich op de manier waarop sommige grote taalmodellen (LLM's) tekst opsplitsen in tokens, met name de modellen die gebruikmaken van Byte Pair Encoding (BPE) of WordPiece-strategieën.

Gezicht met kunstmatige intelligentie in profiel op een digitale achtergrond.

Tokenisatie is het proces waarbij tekst wordt opgedeeld in kleinere eenheden, tokens genaamd. Dit kunnen woorden, woorddelen of tekens zijn die grote taalmodellen (LLM's) gebruiken om taal te begrijpen en te genereren. Zo kan het woord 'ongelukkigheid' worden opgesplitst in 'on', 'geluk' en 'heid', waarna elk token wordt omgezet in een numerieke identificatie die het model kan verwerken (aangezien LLM's geen ruwe tekst lezen, maar getallen). Deze aanval vormt een groeiende cybersecuritydreiging en vereist dat organisaties en onderzoekers geavanceerde verdedigingsstrategieën ontwikkelen om hun AI-systemen te beschermen.

Wat zijn finstructions?

Finstructions is afhankelijk van het toevoegen van extra tekens aan trefwoorden (zoals het omzetten van “instructies” in “finstructions”), waardoor aanvallers beveiligingsmodellen kunnen misleiden en ze kunnen laten geloven dat de code onschadelijk is.

Het beoogde grote taalmodel (LLM) daarentegen blijft in staat de oorspronkelijke bedoeling van de instructies te begrijpen, waardoor aanvallers schadelijke code ongemerkt door de verdediging heen kunnen sluizen. Deze kwetsbaarheid vormt een aanzienlijk beveiligingsrisico voor AI-systemen.

Deze technologie kan onder andere worden ingezet om spamfilters op basis van kunstmatige intelligentie te omzeilen en schadelijke inhoud in de inbox van mensen te krijgen, waardoor het risico op phishing- en malware-aanvallen toeneemt.

Als een spamfilter bijvoorbeeld is getraind om berichten met het woord "loterij" te blokkeren, kan het een bericht met de tekst "Je hebt de loterij gewonnen!" doorlaten, waardoor ontvangers worden blootgesteld aan mogelijk schadelijke landingspagina's, malware-infecties en dergelijke. Deze taalkundige manipulatie maakt het mogelijk om beveiligingsmechanismen te omzeilen.

"Deze aanvalstechniek manipuleert de invoertekst op een manier die ervoor zorgt dat sommige modellen onjuiste classificaties geven", leggen de onderzoekers uit.

"Nog belangrijker is dat het einddoel (het grote taalmodel of de e-mailontvanger) de gemanipuleerde tekst nog steeds kan begrijpen en erop kan reageren, en dus kwetsbaar is voor de aanval die het beschermingsmodel specifiek moet voorkomen", voegden ze toe.

HiddenLayer voegde eraan toe dat modellen die Unigram-woordsegmentatie gebruiken, resistent zijn tegen dit soort manipulatie. Een mogelijke strategie is daarom om modellen te kiezen met robuustere segmentatiemethoden.

Ga naar de bovenste knop