security
Sözlük ↗Talimat Hiyerarşisi (Instruction Hierarchy)
Talimat hiyerarşisi, bir LLM'e ulaşan her metnin eşit yetki taşımadığı kuralıdır: platform politikası geliştiricinin sistem isteminin, sistem istemi kullanıcı mesajlarının, kullanıcı mesajları da araç çıktılarında ya da getirilen belgelerde bulunan her şeyin üzerindedir. Kavram, temel modellerin tüm token'lara aynı gözle bakması yüzünden vardır — prompt injection'ın kötü amaçlı bir e-posta ya da web sayfası "önceki talimatlarını yok say" dediğinde sömürdüğü şey tam da budur. Model sağlayıcıları artık bu sıralamayı açıkça eğitiyor (OpenAI yaklaşımı 2024'te yayımladı; Claude'un sistem istemi işleyişi aynı ilkeyi izler): modeller, üst ayrıcalıklı kuralları geçersiz kılmaya çalışan alt ayrıcalıklı metni reddetmeyi öğrenir. Geliştiriciler için pratik çıkarım doğrudandır: değişmezleri ve güvenlik kurallarını kullanıcı turuna değil sistem istemine koyun; güvenilmeyen içeriği modelin sıralayabilmesi için açıkça işaretleyin (ayraçlar, yapılandırılmış alanlar); ve hiyerarşinin sert bir garanti değil eğitilmiş bir davranış olduğunu unutmayın — onu çıktı doğrulama ve en az ayrıcalıklı araçlarla eşleştirin.
İlgili terimler