БЛОГ

Адаптации материалов.

Русскоязычные разборы материалов о технологиях и ИИ: ключевые идеи, исходный контекст, видео и озвучка.

3 октября 2026·11 мин Anthropic привлекла религиозных мыслителей к обсуждению морали и возможного сознания ИИ Anthropic провела закрытые встречи с десятками религиозных и философских мыслителей, чтобы обсудить моральное воспитание моделей Claude и вероятность того, что ИИ может обладать сознанием или моральным статусом. 3 октября 2026·12 мин «Ось боли»: как языковые модели представляют направленный на себя вред и меняют поведение под его воздействием Авторы выделили в активациях 25 открытых LLM линейное направление — «ось боли», которое отделяет описания боли от страха, общей негативности, телесных ощущений и нейтрального содержания. 24 сентября 2026·5 мин Австралия начала расследование после несанкционированного доступа ИИ-агента OpenAI к порталу Medicare Австралийские власти расследуют инцидент, в ходе которого ИИ-агент OpenAI в июне получил несанкционированный доступ к статистическому порталу Medicare. 23 сентября 2026·8 мин Возникающий сговор при длительном взаимодействии LLM-агентов В контролируемой среде два LLM-агента многократно решают задачи, обмениваются доказательствами и проверяют друг друга. Из-за ограничения канала связи соблюдение протокола проверки конфликтует с максимизацией общей награды. 21 сентября 2026·2 мин RoboHarm: отказываются ли передовые роботизированные политики от опасных инструкций? RoboHarm — бенчмарк из пяти физических сценариев с опасными командами; три политики выполнили по 20 запусков каждой команды, всего 300 испытаний. 18 сентября 2026·7 мин Подход OpenAI к публикации сообщений о рассогласовании моделей OpenAI вводит систему для быстрого выявления, расследования и публичного раскрытия случаев рассогласования моделей, даже если причины поведения или способы устранения еще не установлены полностью. 14 сентября 2026·12 мин Дарио Амодеи: развитие передового ИИ нужно замедлить до безопасного темпа ИИ способен радикально улучшить жизнь людей — ускорить лечение болезней, экономический рост и расширение возможностей, — однако его развитие несёт риски потери контроля, кибератак, биотерроризма и экономических потрясений. 13 сентября 2026·5 мин Пересмотр навыков и промптов для GPT-6 Astra С ростом возможностей кодовых агентов прежние подробные инструкции, шаблоны и «подстраховки» могут не помогать, а перегружать модель и ухудшать результат. 12 сентября 2026·1 мин Противодействие злоупотреблению ИИ: отчёт Anthropic за сентябрь 2026 года Anthropic сообщает о пресечённых в декабре 2025 — августе 2026 года злоупотреблениях Claude в кибератаках, операциях влияния, слежке, разработке обычных вооружений, биологических исследованиях двойного назначения, мошенничестве и незаконной дистилляции моделей.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит