← Библиотека

Интеллект и управление

Dirk Bergemann · Andrew Koh · Stephen Morris

Mechanism Design for Alignment and Control

2026

Дизайн механизмов предлагает формализовать стимулы при делегировании и контроле ИИ.

В книгеДелегирование, цели и самостоятельность решений

Выборочное чтение

Разобраны выбранные контексты; сплошное чтение источника не заявлено. Страницы файла: 1, 8–12, 42–43, 58.

3 карточки

Тезисы пересказывают выбранные места источников; применение — мысль редакции. Объём чтения указан у каждого источника. Цитаты приведены только там, где сверены с текстом.

Показано 3 из 3

  1. 01

    Правда о себе ещё не означает исполнения поручения

    Условие совместимости стимулов исключает совместное отклонение: агент может сначала исказить сообщение о типе, затем нарушить план после получения информации.

    Для книги

    Последнее поручение требует двух проверок: достоверности заявления о возможностях и выгодности фактического исполнения после нового знания.

    Контекст и границы
    • Рамка предполагает заданные типы, действия, предпочтения и вознаграждения.
    • Она не даёт готового договора с будущей системой неизвестной структуры.
    Место в источнике

    Страницы PDF: 10–11

    Ссылка на мысль
  2. 02

    Более сильный агент может выдать себя за слабого

    В заданном порядке проверяемости свидетельство можно скрыть, но нельзя подделать: более способный тип может имитировать менее способный.

    Для книги

    Тест должен проверять стимул скрывать способность, а не принимать ограниченный результат испытания за верхний предел возможностей.

    Контекст и границы
    • Односторонняя имитация — предпосылка модели, а не доказанная универсальная характеристика ИИ.
    • Авторы сохраняют commitment; работа не решает проблему будущего отказа организатора от договора.
    Место в источнике

    Страницы PDF: 8, 12

    Ссылка на мысль
  3. 03

    Взаимная проверка агентов имеет сильные условия

    При различимых убеждениях типов о партнёрах подходящее взаимное вознаграждение реализует допустимое правило на поддержке заданного распределения типов.

    Для книги

    Конкурирующие проверяющие — содержательная альтернатива прямому человеческому контролю; её нужно испытать против совпадения информации и коалиций.

    Контекст и границы
    • Нужны модель убеждений, достаточно большие вознаграждения и возможность запрещать действия.
    • Реализуемость означает наличие нужного равновесия; исключение всех нежелательных равновесий и сговора не доказано.
    • Организатор использует заданные функции полезности типов и карту их убеждений; построение вознаграждения не решает задачу распознавания неизвестных целей.
    Место в источнике

    Страницы PDF: 12, 42–44

    Ссылка на мысль
← Вернуться к источникам