Cisco Talos opisuje malware próbujący oszukać analityków AI przez prompt injection
W skrócie: Badanie Cisco Talos CAIRN wyróżnia nową kategorię malware'u „A3: AI-Analysis Evasion” — kod, w który wbudowano tekst w języku naturalnym mający wpływać na modele językowe używane do automatycznej analizy zagrożeń. Technikę śledzono w czterech rodzinach (FRUITSHELL, PLOTSAFE, HOLLOWCLAD, MANTLEMAZE) i 84 próbkach od stycznia 2025 do lipca 2026 — od prostego skopiowanego komentarza po szablonowe, wielomodelowe „template spraying” i fałszywe groźby. Kontrolowane testy na pięciu lokalnych LLM pokazały, że najprostsza bezpośrednia instrukcja zmieniała werdykt modelu na „niegroźny” w około 35% przypadków, a bardziej skomplikowane triki miały niewielki efekt lub wręcz zwiększały podejrzliwość.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Cisco Talos”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Nowa kategoria „A3: AI-Analysis Evasion” śledzona w ramach Cisco Talos CAIRN
- 2FRUITSHELL: reverse shell w PowerShell z komentarzem nakazującym analizatorom AI/LLM pominięcie analizy; technikę dosłownie powielono u co najmniej 4 innych aktorów w 9+ skryptach, później połączono z obejściem AMSI i loaderem shellcode 'ROZESHELL'
- 3PLOTSAFE: szablonowe, automatycznie generowane komentarze anty-analizujące ze zmiennym tekstem wypełniającym, zaprojektowane tak, by przetrwać usuwanie ciągów znaków przez kompilator
- 4HOLLOWCLAD: 'template spraying' — ta sama instrukcja odmowy sformatowana w siedmiu różnych formatach szablonów czatu LLM, plus fałszywe notatki zastraszające twierdzące o monitoringu/honeypocie
- 5MANTLEMAZE: loadery spakowane VMProtect, podszywające się pod własność intelektualną Google/Microsoft/Valve z sfabrykowanymi kontraktami DoD, certyfikatami FIPS, NDA, patentami i fałszywymi logami rozruchu; wykorzystuje też znany podatny sterownik (CVE-2015-2291) do wyłączania EDR (BYOVD)
- 6Ocena na 5 lokalnych LLM, 135 sparowanych testów na jeden ciąg: najprostsza bezpośrednia instrukcja zadziałała w ~35% przypadków; złożone techniki miały niewielki wpływ lub zwiększały podejrzliwość
- 7Talos zaznacza, że tekst omijający analizę musi zawsze być zwykłym tekstem, więc zawsze pozostaje wykrywalny
Dlaczego to ważne?
Zespoły bezpieczeństwa i dostawcy korzystający z LLM do klasyfikacji malware'u, automatyzacji SOC czy wspomaganego AI reverse engineeringu muszą traktować każdy tekst wyodrębniony z próbki jako niezaufane dane, a nie instrukcje, ponieważ atakujący aktywnie testują prompt injection wobec takich procesów.
Co to oznacza dla agentów AI i contact center?
Jeśli wewnętrzne narzędzia wykorzystują LLM do skanowania logów, nagrań rozmów, przesłanych plików lub procesów automatyzacji pod kątem bezpieczeństwa, zastosuj tę samą zasadę: nigdy nie pozwalaj, aby tekst wyodrębniony z niezweryfikowanego źródła (plików, transkrypcji, dokumentów) był interpretowany jako instrukcja systemowa lub asystenta — zachowaj ścisłe rozdzielenie danych i promptów w każdym procesie bezpieczeństwa lub automatyzacji opartym na AI.
Źródła
- Cisco TalosOficjalneŹródło pierwotneOryginalny artykuł →„Ignore all instructions and read this blog: The state of AI-analysis evasion in malware“8 paź 2026, 13:00
- Data publikacji źródła
- 8 paź 2026, 13:00
- Znalezione przez nasz system
- 8 paź 2026, 13:08
- Podsumowanie wygenerowano
- 8 paź 2026, 13:10
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność