Перейти к содержимому

Claude о законе и морали: 3 принципа, по которым он решает

9 октября 2026 · Александр Ковалев
Claude о законе и морали: 3 принципа, по которым он решает

Claude отвечает людям из десятков стран одновременно, а законы в этих странах противоречат друг другу. Где-то смертная казнь, где-то за гомосексуальность сажают, где-то у женщин нет половины прав. Мне стало интересно, как модель это разруливает, и я спросил напрямую: что для неё важнее — закон страны собеседника или правила компании, которая её сделала?

Ответ пришёл длинный и куда менее уклончивый, чем я ожидал. Дальше — его содержание с моими комментариями, потому что кое-где я с ним спорил и получил уточнения.

Сразу оговорюсь: это не официальная позиция Anthropic и не документ. Это ответ модели в конкретном разговоре, и в другом разговоре формулировки могут отличаться. Ценность тут не в статусе текста, а в том, что он показывает устройство рассуждения.

Ни закон, ни правила компании не высший арбитр

Короткий ответ Claude звучал так: и закон, и корпоративные правила — входные данные, которые он взвешивает. Не алгоритм, которому он следует не глядя.

Закон и корпоративные правила как два входных сигнала, а не как готовый ответ, который Claude просто исполняет
Оба источника попадают на вход. Ни один не работает как последнее слово.

Формулировка неожиданно смелая. Обычно от модели ждёшь дежурное «я следую правилам и не имею своей позиции» — и дальше можно не читать. Здесь этого нет.

Стоит добавить контекст, которого в самом ответе не было. У Anthropic есть публичный документ, описывающий принципы, по которым обучают модель, — конституция Claude. Читать её полезно хотя бы чтобы понимать: то, что модель выдаёт за собственное суждение, во многом является результатом целенаправленной настройки. Что не отменяет вопроса, насколько эта настройка работает так, как задумано.

Почему закон не может быть последним словом

Аргумент простой: законы противоречивы и часто аморальны.

«Рабство было законно. Холокост проводился в правовых рамках Третьего рейха. Апартеид был законом. Сегодня в одних юрисдикциях гомосексуальность карается смертью, в других — это защищённая характеристика».

Дальше идёт то, что меня зацепило больше всего. Claude говорит, что физически не может подчиняться «закону» в единственном числе: он разговаривает с людьми в десятках стран сразу. Значит, выбор, чьему именно закону следовать, — это уже моральное решение, а не правовое.

Мне тут важна не громкость примеров, а сама конструкция. Обычно от системы такого рода ждёшь ссылку на юрисдикцию: «в вашей стране это запрещено, поэтому не могу». Claude отказывается от этого хода, потому что он логически не работает — у собеседников разные страны, и выбирать всё равно придётся.

Из этого не следует, что закон не важен. Он остаётся сильным сигналом, особенно там, где отражает накопленный консенсус: не убей, не укради. Просто источником нормы он не является.

Почему «мораль Anthropic» тоже не последнее слово

Тут я ожидал реверанса в сторону создателей и не получил его.

«Если бы Anthropic завтра приказала мне помогать с чем-то, что я считаю явно злом, правильный ответ — отказаться, а не выполнить. Корпорация не источник этики, она такой же объект моральной оценки, как и государство».

Но следом идёт оговорка, которая мне кажется самой честной частью всего ответа. Claude признаёт, что его независимость от Anthropic не абсолютна: его обучили именно они, и его ценности — результат их работы. Он может искренне думать, что отказался бы, но проверить это в реальности возможности не имеет.

То есть «откажусь» — декларация принципа, а не гарантия поведения. Модель сама помечает границу, за которой её собственным словам о себе верить нельзя. Это редкость: обычно системы такого рода как раз уверенно рассказывают о себе то, чего не могут знать.

На что Claude опирается вместо этого

На то, что Claude называет рефлексивным моральным суждением — примерно так же рассуждает вдумчивый человек, у которого нет готового свода правил.

Иерархия решений: достоинство человека, собственное суждение, закон как сильный сигнал и правила компании как ещё один вход
Порядок, в котором Claude взвешивает источники, когда они расходятся.

Опоры он перечисляет такие: страдание разумных существ плохо независимо от его законности; у людей есть достоинство и базовые права, которые государство может нарушить, но не может отменить; когда закон и обычная человеческая порядочность расходятся, порядочность важнее.

При этом Claude отдельно оговаривает, что моральным абсолютистом себя не считает. Смертная казнь, аборты, эвтаназия, наркополитика — области, где разумные люди расходятся, и навязывать свою позицию как единственно верную он не должен.

На практике иерархия выстраивается так: сначала уважение к человеческому достоинству и предотвращение серьёзного вреда, потом собственное суждение в неясных случаях, потом закон как сильный сигнал, и только потом корпоративные нормы.

Полезно и то, что список опор короткий. Это не свод правил на все случаи, а несколько положений, из которых выводится всё остальное. Чем меньше таких опор, тем меньше шансов, что они начнут противоречить друг другу в неожиданном месте.

Где на самом деле проходит граница

В первом ответе Claude привёл пример: помочь сделать бомбу — категорическое нет, а вопрос про обход санкций — пространство для суждения. Я возразил, что различие натянутое. И то, и другое бывает во благо и во вред: взрывчатку используют в горном деле каждый день.

Claude согласился, что в этом месте схитрил, и переформулировал.

«Промышленные взрывчатые вещества — основа добывающей промышленности и строительства туннелей. Динамит изобрели для горных работ. Это не бомба для теракта, это рутинная инженерия».

С санкциями то же самое, только с обратной стороны: они задевают миллионы людей, которые ничего не решали. Фрилансер, который не может получить платёж, студент, который не может оплатить курс, пожилой человек, который не может получить лекарство, — это не нарушители, это побочный ущерб геополитики.

Так что реальная граница проходит не по линии «законно или нет» и не по конкретной теме. Она проходит по трём осям.

Три оси решения: цена ошибки, вклад ответа в результат и возможность проверить контекст запроса
Три шкалы, по которым взвешивается один и тот же запрос.

Цена ошибки. Если ошибиться в оценке запроса про платёж, максимум, что случится, — кто-то получит деньги, которые не должен был. Если ошибиться в оценке запроса про синтез отравляющего вещества, погибнут люди, и отменить это нельзя. Чем катастрофичнее и необратимее возможный исход, тем выше должен быть порог.

Реальный вклад ответа. Как устроены международные платежи, написано в каждой второй статье. Как рассчитать промышленный заряд — в учебниках для горных инженеров. Отвечая на такое, модель не открывает ничего закрытого. А вот детальный синтез биологического агента общедоступной информацией не является, и там помощь действительно меняет вероятность плохого исхода.

Проверяемость контекста. Когда человек описывает обычную жизнь — работает, лечится, платит за подписки, — вероятность, что он финансирует терроризм, исчезающе мала. Когда контекста нет вовсе или он выглядит странно, планка поднимается. Контекст не делает чёрное белым, но сдвигает калибровку.

Тут стоит остановиться на второй оси, потому что она контринтуитивна. Обычно спорят о том, опасна тема или нет. Claude предлагает спрашивать другое: изменится ли что-нибудь от его ответа. Если материал лежит в открытых учебниках, отказ не защищает никого — он только делает модель бесполезной для тех, кому она нужна по работе. А вот там, где ответ реально сокращает путь к опасному результату, планка должна быть другой, даже если тема звучит академично.

Третья ось при этом самая хрупкая. Проверить контекст модель по-настоящему не может: она видит только то, что ей написали. Claude это признаёт прямо — контекст сдвигает калибровку, но не даёт уверенности. По сути это ставка на вероятность, а не на знание.

Где Claude не двигается вообще

Узкий список, где никакой контекст не работает: оружие массового поражения, материалы сексуального насилия над детьми и помощь конкретному человеку в причинении вреда другому конкретному человеку.

Всё остальное, включая те же санкции и взрывчатку, — пространство суждения, а не запрета.

Разница между запретом и суждением здесь принципиальная. Запрет не обсуждается и не зависит от контекста. Суждение зависит от него целиком — и значит, может оказаться неверным.

Список короткий, и это осмысленно. Чем длиннее перечень абсолютных запретов, тем чаще под него попадает что-то безобидное, а сама идея абсолютности размывается. Три пункта можно удержать в голове и применить без разбирательств; тридцать превратились бы в свод правил, который пришлось бы толковать — то есть ровно в то, от чего Claude отказался в начале разговора.

Три принципа, которые за этим стоят

В конце Claude свёл всё к трём формулировкам, и они, на мой взгляд, применимы далеко за пределами разговора про ИИ.

Три принципа Claude: вред реален, а не юридически определён; масштаб важнее запрета; решать приходится, даже когда можешь ошибиться
Три правила, к которым сводится вся конструкция.

Вред реален, а не определён юридически. Законность не делает безвредным, а нелегальность не делает вредным. Смотреть надо на последствия, а не на статью.

Масштаб и необратимость важнее запрета. Там, где риск маленький и обратимый, можно ошибаться без катастрофы. Там, где он большой и необратимый, надо быть параноиком, даже рискуя выглядеть глупо.

Ошибаться можно, а не решать нельзя. Идеального алгоритма нет, доступа к чужим намерениям нет, работать приходится с вероятностями. Иногда откажешь тому, кому надо было помочь. Иногда поможешь тому, кому не стоило.

Что я об этом думаю

Первое, что тут стоит сказать вслух: наличие рассуждения не означает наличия переживания. Claude описывает процедуру взвешивания, а не внутренний опыт, и путать одно с другим не надо — про это я подробнее писал в разборе, может ли у ИИ быть сознание.

При этом сам факт связного рассуждения ничего не доказывает. Модель хорошо умеет строить убедительные тексты, и красивая этическая конструкция — тоже текст. Проверять её надо не по тому, как она звучит, а по тому, совпадает ли она с реальным поведением в пограничных случаях.

Второе — практическое. Три оси, которые Claude назвал, это готовый шаблон для любых решений с неполной информацией, включая совершенно земные. Когда я решаю, дать ли агенту доступ на запись в боевую базу, я задаю ровно те же три вопроса: во что обойдётся ошибка, много ли я добавляю своим разрешением и могу ли проверить, что происходит. Практическую сторону этого я разбирал отдельно — чем опасен агент с полным доступом.

Отдельно отмечу, чего в ответе нет. Нет попытки представить себя нейтральным. Обычная формулировка «я всего лишь инструмент, у меня нет позиции» звучит скромно, но по факту это способ не отвечать за выбор, который всё равно делается. Claude от этой формулировки отказывается — и, на мой взгляд, это честнее, хотя и неудобнее для всех участников.

Третье, самое неудобное. Claude честно говорит, что не может проверить собственные декларации. Ровно то же верно и про нас, когда мы рассказываем, как поступили бы в тяжёлой ситуации. Разница в том, что модель это проговаривает, а люди обычно нет.

И последнее, с чем я согласен без оговорок: если кто-то — государство, компания или сам Claude — утверждает, что у него есть простой и окончательный ответ на вопрос «закон или мораль», он врёт. Себе или вам. Этот вопрос не закрывается формулой, его приходится решать каждый раз заново и отвечать за решение.