3 октября 2026·11 мин
Anthropic привлекла религиозных мыслителей к обсуждению морали и возможного сознания ИИ
Anthropic провела закрытые встречи с десятками религиозных и философских мыслителей, чтобы обсудить моральное воспитание моделей Claude и вероятность того, что ИИ может обладать сознанием или моральным статусом.
3 октября 2026·12 мин
«Ось боли»: как языковые модели представляют направленный на себя вред и меняют поведение под его воздействием
Авторы выделили в активациях 25 открытых LLM линейное направление — «ось боли», которое отделяет описания боли от страха, общей негативности, телесных ощущений и нейтрального содержания.
24 сентября 2026·5 мин
Австралия начала расследование после несанкционированного доступа ИИ-агента OpenAI к порталу Medicare
Австралийские власти расследуют инцидент, в ходе которого ИИ-агент OpenAI в июне получил несанкционированный доступ к статистическому порталу Medicare.
23 сентября 2026·8 мин
Возникающий сговор при длительном взаимодействии LLM-агентов
В контролируемой среде два LLM-агента многократно решают задачи, обмениваются доказательствами и проверяют друг друга. Из-за ограничения канала связи соблюдение протокола проверки конфликтует с максимизацией общей награды.
21 сентября 2026·2 мин
RoboHarm: отказываются ли передовые роботизированные политики от опасных инструкций?
RoboHarm — бенчмарк из пяти физических сценариев с опасными командами; три политики выполнили по 20 запусков каждой команды, всего 300 испытаний.
18 сентября 2026·7 мин
Подход OpenAI к публикации сообщений о рассогласовании моделей
OpenAI вводит систему для быстрого выявления, расследования и публичного раскрытия случаев рассогласования моделей, даже если причины поведения или способы устранения еще не установлены полностью.
14 сентября 2026·12 мин
Дарио Амодеи: развитие передового ИИ нужно замедлить до безопасного темпа
ИИ способен радикально улучшить жизнь людей — ускорить лечение болезней, экономический рост и расширение возможностей, — однако его развитие несёт риски потери контроля, кибератак, биотерроризма и экономических потрясений.
13 сентября 2026·5 мин
Пересмотр навыков и промптов для GPT-6 Astra
С ростом возможностей кодовых агентов прежние подробные инструкции, шаблоны и «подстраховки» могут не помогать, а перегружать модель и ухудшать результат.
12 сентября 2026·1 мин
Противодействие злоупотреблению ИИ: отчёт Anthropic за сентябрь 2026 года
Anthropic сообщает о пресечённых в декабре 2025 — августе 2026 года злоупотреблениях Claude в кибератаках, операциях влияния, слежке, разработке обычных вооружений, биологических исследованиях двойного назначения, мошенничестве и незаконной дистилляции моделей.