avatar
PWN AI
@pwnai
28.05.2026 19:52
Как можно было бы защититься (не ещё один сканер)

CaMeL. Вроде частично идея из аппсека: разделить поток управления и поток данных. Система извлекает план действий из доверенного запроса пользователя, и недоверенные данные физически не могут повлиять на поток управления. К каждому значению цепляется некое описание возможностей - не подделываемый токен прав, по которому политика разрешает или блокирует действие при вызове тула. Всё это в песочнице, без переобучения модели.

Важная оговорка под нашу тему: CaMeL и другие детерминированные защиты предполагают, что поток управления известен заранее из доверенного источника. Скиллы это ломают по построению - они в рантайме добавляют инструкции из стороннего источника. Поэтому в лоб такой подход к скиллам не переносится, и это также отмечают сами авторы SKILL-INJECT.

Авторизация и целостность контекста. Один и тот же поток данных нормален в одном контексте и недопустим в другом - зависит от того, кто, что, кому и при каких условиях передаёт. Для защиты скиллов это важно, ведь система должна рассуждать о чувствительности текущей задачи, об источнике скилла и о риске конкретного действия, а не сканировать текст.

Governance с манифестом прав - Skill Trust and Lifecycle Governance Framework показывает четыре уровня доверия и набор шлюзов: семантическая проверка на расхождение заявленной цели скилла и реальных инструкций, поведенческая песочница для невидимых статике побочных эффектов, валидация манифеста прав (тулы, пути, сеть) против наблюдаемого поведения. Объём прав определяют провенанс и пройденные шлюзы - по принципу наименьших привилегий и не бинарно, а градацией.

Все эти меры происходят из того что скилл = недоверенный код по умолчанию, права привязываются к минимально необходимому набору возможностей, а действия с внешними задачами требуют авторизации по контексту.

Если вы думаете, что я вообще против скиллов – то это не так. Скиллы это прикольная возможность быстро проверить какую-либо концепцию. Например, я юзаю самописные скиллы для поиска интересных записей медитации, вещей, быстрой проверки гипотез по данным, да и просто для генерации идей.

Сейчас я бы хотел поделиться с вами одним из скиллов, который позволяет моделировать распространение и возможность использование каких-либо угроз. Как в игре, где надо заражать планету. Просто мы должны помнить, что безопасность прежде всего.
👍 7
5
4
7 21 2K

Обсуждение 7

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

PWN AI

6.8K
На 99% состоит из людей.

Хроники о небезопасном ИИ.
Не нравится? Смени телек.

Не продамся вашей рекламе - никогда.

"Мнение автора" != "Мнение компании, где автор работает".

Папка с каналами по безопасности ИИ:
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Открыть в Telegram