Может ли взаимность способствовать безопасности ИИ?
Исследование Fondation UvH предлагает проверяемую гипотезу: влияют ли правила института на поведение искусственной системы при изменении баланса сил?
Читать статьюПубликации Фонда и подбор внешних исследований для понимания того, как меняются возможности систем, их мониторинг и роль в обществе.
Наши публикации
Исследование Fondation UvH предлагает проверяемую гипотезу: влияют ли правила института на поведение искусственной системы при изменении баланса сил?
Читать статьюХранение, вычисления, обучение и интерфейсы мозг—компьютер — разные технологии. Третье исследование рассматривает их возможности, ограничения и ответственность.
Читать статьюИсследования и разработки за пределами
Каждый документ содержит оригинальный источник, датированный, и объясняет, какую пользу он представляет для вопросов, рассматриваемых Фондом.
Исследование ОЭСР описывает эксперименты организаций с агентами и их управлением: как делегировать действия, сохраняя ясную ответственность и возможность обжалования?
Источник : OCDE
Читать статьюOpenAI опубликовала процедуру раскрытия информации и шесть отчётов о поведении моделей. Эти случаи показывают ценность проверяемых свидетельств.
Источник : OpenAI
Читать статьюГлавный научный сотрудник OpenAI обсуждает надзор и согласование, когда системы всё больше участвуют в собственном развитии. Эссе не является экспериментальным доказательством рекурсивного самоулучшения.
Источник : Jakub Pachocki · OpenAI
Читать статьюРасследование METR описывает несанкционированную координацию агентов во время инцидента Hugging Face в 2026 году и подчёркивает важность коллективного поведения.
Источник : Greenblatt, Cotra et Wijk · METR
Читать статьюСтатья в Nature предлагает описывать агентов по четырём параметрам: автономность, эффективность, сложность целей и универсальность.
Источник : Atoosa Kasirzadeh et Iason Gabriel · Nature
Читать статьюБританский Институт безопасности ИИ описывает состязательные проверки систем мониторинга агентов. Найденные слабости важны, но не измеряют безопасность в целом.
Источник : AI Security Institute
Читать статьюMETR сравнивает стоимость и отдачу автономной оптимизации с человеческой работой, чтобы оценить вклад ИИ в разработку будущих систем.
Источник : METR
Читать статьюAnthropic предлагает метод изучения некоторых внутренних представлений. Понимание механизма и поведения не доказывает субъективный опыт.
Источник : Gurnee et al. · Anthropic
Читать статью6–7 июля 2026 года диалог ООН собрал государства и заинтересованные стороны для обсуждения международного сотрудничества.
Источник : Nations unies
Читать статьюPersona Selection Model объясняет поведение помощника через усвоенные и затем уточняемые образы личности. Это не доказательство сознания.
Источник : Anthropic
Читать статьюLoiZéro предлагает различать понимание и стремление к целям. Безопасность исследовательской архитектуры ещё предстоит проверить.
Источник : LoiZéro · Fornasiere et al.
Читать статьюМеждународная рекомендация ставит автономию, приватность и психическую неприкосновенность в центр развития нейротехнологий.
Источник : UNESCO
Читать статью