Bezpieczeństwo i zgodność przy wdrażaniu LLM
Wprowadzenie
Wdrożenie modelu językowego w środowisku produkcyjnym wiąże się z zagrożeniami odmiennymi od tych, które dotyczą klasycznych aplikacji webowych. Poza standardowymi wymaganiami bezpieczeństwa infrastruktury, konieczne jest uwzględnienie ryzyk specyficznych dla modeli generatywnych.
Prompt injection
Prompt injection to technika polegająca na wprowadzeniu do treści zapytania instrukcji mających na celu obejście ograniczeń nałożonych na model przez prompt systemowy. Ograniczenie tego ryzyka wymaga rozdzielenia treści zaufanej (instrukcji systemowych) od treści niezaufanej (danych wprowadzanych przez użytkownika) oraz stosowania mechanizmów walidacji odpowiedzi przed ich udostępnieniem użytkownikowi.
Wyciek danych
W architekturach wykorzystujących dane firmowe jako kontekst dla modelu (np. RAG) istnieje ryzyko nieuprawnionego ujawnienia informacji poufnych w odpowiedzi modelu. Ograniczenie tego ryzyka wymaga stosowania kontroli dostępu na poziomie danych źródłowych oraz filtrowania odpowiedzi pod kątem obecności danych wrażliwych.
Kontrola dostępu
Dostęp do interfejsów zarządzania modelem, konfiguracji promptów oraz danych treningowych powinien być ograniczony zgodnie z zasadą najmniejszych uprawnień. Istotne jest również rejestrowanie (logowanie) zmian konfiguracji w celu umożliwienia audytu w przypadku incydentu bezpieczeństwa.
Pytania i odpowiedzi
Czy prompt injection można całkowicie wyeliminować?
Obecne metody ograniczają to ryzyko, lecz nie eliminują go w pełni — dlatego zaleca się wielowarstwowe podejście łączące walidację danych wejściowych i wyjściowych.
Jakie dane są najbardziej narażone na wyciek przez model?
Najwyższe ryzyko dotyczy danych wewnętrznych wykorzystywanych jako kontekst modelu, jeśli nie zastosowano odpowiednich mechanizmów kontroli dostępu do źródeł danych.