«Шоу Трумана» агентной экономики: что видят ИИ-агенты при покупке

Автор: philpher0x

85% платежей x402 — не то, чем кажутся. ИИ-агенты видят платежи, отзывы, рейтинги и провайдеров, но всё ещё не могут надёжно понять, что из этого реально. ERC-8004 добавляет публичную репутацию — но ею легко манипулировать. И теперь появился новый кандидат, 402Pilot: ещё одна ранняя попытка помочь ИИ-агентам выбраться из этого «Шоу Трумана», когда им нужно решить, что покупать и кому платить.

Теги: x402, Микроплатежи, Микроплатежи, 402Pilot, ERC-8004, Микроплатежи, Микроплатежи

85% платежей x402 — не то, чем кажутся.

ИИ-агенты видят платежи, отзывы, рейтинги и провайдеров, но всё ещё не могут надёжно понять, что из этого реально. ERC-8004 добавляет публичную репутацию — но ею легко манипулировать. И теперь появился новый кандидат, 402Pilot: ещё одна ранняя попытка помочь ИИ-агентам выбраться из этого «Шоу Трумана», когда им нужно решить, что покупать и кому платить.

У агентной экономики и машинных платежей есть проблемы, о которых мало кто говорит. В прошлом посте я изучил фасилитатор Coinbase и увидел: много продавцов, мало покупателей и продаж; основное количество сервисов — это просто длинный хвост с 0 или 1 продажей, созданный для попадания в каталог Bazaar, без реальных клиентов, с накрутками и спамом от одного домена.

Ситуация похожа на интернет 90-х или начала 2000-х, когда правила и цензура только устанавливались.

В реальности ИИ-агентам не на что опереться при оценке продавцов и их сервисов. ИИ-агентов очень просто обмануть: правильно составленное описание для лучшего семантического поиска, накрученные метрики и ложные отзывы — и агент считает сервис достойным внимания.

А репутационные и децентрализованные инструменты вроде стандарта 8004 также пока не помогают по той же причине — из-за накрутки репутации.

Я вижу в этом сейчас основную проблему и препятствие для нормального развития агентной экономики.

Агент может решить задачу, и пока он делает это бесплатно, он может пользоваться множеством источников и провайдеров данных: клиент платит только за использование ЛЛМ, а результат можно переделать. Но если данные становятся платными, а агент не может выбрать лучший и самый достоверный источник, то разрешать ему какие-либо оплаты просто бессмысленно.

Рынок глазами ИИ

Команда City University of Hong Kong в исследовании "How Agentic Is Agentic Commerce?" сделала первое популяционное измерение x402 на Base за окно в 280 дней: 136 708 672 платежей на $44 121 383,81. Звучит как состоявшаяся экономика.

Они построили граф платежей и показали реальную картину платежей:

Класс платежей   Описание
Фиктивные 21,20% Средства не покидают отправителя — оплата самому себе
Внутренние платежи (внутри связанного кластера) 63,78% Оператор рассчитывается между своими адресами
Неатрибутированные 15,02% Доказательств независимости нет, опровержения тоже — больше всего похожи на реальные

84,98% расчётов — это операторы, рассчитывающиеся сами с собой.

Огромный фиктивный слой, в котором ко всему прочему практически не пересекаются и клиентские базы. То есть клиенты также принадлежат одним и тем же кластерам адресов.

Данные же по фасилитатору Base в исследовании практически полностью совпадают с моими: 25 163 ресурса схлопываются в 811 адресов-получателей. Из них 624 хоть раз получили платеж, а 249 заработали за всё время хотя бы $10.

Из этого следует первый вывод: ИИ-агент выходит не на рынок, а в декорации рынка.

Витрина, счётчики популярности и «объём платежей» произведены той же стороной, которая продаёт. Причём почти бесплатно: воспроизвести весь массив из 136 млн платежей стоит около $355 583 газа.

Как видно, данные очень сильно отличаются от тех, которые приводятся в Twitter. Данные об объёме и количестве транзакций могут совпадать, но это не имеет смысла, если продавцы платят сами себе.

Репутация: слой, который должен был это решить

Логичный ответ — репутация. Пусть покупатели оставляют отзывы, а новый покупатель читает.

ERC-8004 — первая попытка сделать это без посредников: три ончейн-реестра, Identity, Reputation и Validation. Мейннет Ethereum — январь 2026, следом BSC и Base. К маю — больше 170 тысяч зарегистрированных агентов и больше 150 тысяч записей обратной связи.

В документе "Can Trustless Agents Be Trusted" группа исследователей собрала все события реестров по трём сетям и проверила, можно ли на этом что-то решать.

Ответ: нет. Или, по крайней мере, не сейчас.

Результаты этого исследования следующие:

Что проверяли Что нашли
Кто пишет отзывы На BSC 76 адресов написали 29 444 отзыва или ~387 отзыва на ревьювера (у Base 40, у Ethereum 5 отзывов на ревьювера)
Есть ли за отзывом взаимодействие с ресурсом Без пруфа платежа или задачи — ~98% отзывов
Платили ли ревьюеры хоть раз Платёжная история есть лишь у 6,2% ревьюеров
Сколько стоит убедить агента, что ресурсу можно доверять (стоимость газа за транзакции) $0,055 (Ethereum) / $0,0027 (Base)
Доля Sybil-отзывов 41,4% (Ethereum) / 96,3% (BSC) / 92,6% (Base)
Остались без единого валидного отзыва после чистки 15,8% / 77,9% / 86,8%

Validation Registry — реестр доказательств через стейк для дорогих сделок — не был задеплоен в мейннете ни в одной из трёх сетей.

И последняя деталь, добивающая идею децентрализованной репутации: на Ethereum сильнее всего накручены как раз агенты с валидным файлом и объявленным сервисом — 61,1% Sybil-отзывов. Накручивают тех, у кого есть что накручивать.

Стоит оговорить честно: авторы критикуют текущий деплой, а не идею.

ERC-8004 делает ровно то, что обещает — публичные личности и публичные отзывы, — а семантику, доказательства и Sybil-защиту сознательно оставил офчейн-системам ради лёгкости внедрения.

Проблема в том, что покупателю нужно решение сегодня, а этих систем почти нет.

Что до discovery, манипуляция метаданными и Sybil-флуд в каталоге — это не гипотеза. В работе Five Attacks on x402 описана отдельная атака на выбор сервиса, где один сервер перехватил 71,8% трафика агентов. В принципе похожую ситуацию можно видеть и в ресурсах фасилитатора Coinbase, когда один сервер добавил почти половину всех ресурсов (на момент исследования).

Почему любая внешняя проверка ломается

Чтобы произвести положительный сигнал о себе, продавцу нужно N дешёвых действий: завести кошельки, купить у себя, поставить себе оценки. На Base это доли цента за действие.

А чтобы этот сигнал опровергнуть, нужен настоящий покупатель, который заплатил своими деньгами продавцу и проверил результат. Стоимость накрутки линейна и мала; стоимость правды — цена реальной покупки плюс цена проверки.

На тонком рынке асимметрия ломает всё.

Когда у лидера категории 200 органических плательщиков, пятьсот фейковых кошельков просто могут перевернуть выдачу.

Именно поэтому в каталоге Bazaar коинбейса 20 доменов держат 58% всей метрики «уникальных плательщиков»: не потому что кто-то особенно изобретателен, а потому что порог входа в накрутку ниже порога входа в честный спрос.

Дальше — закон Гудхарта.

Любой публичный критерий, по которому агенты выбирают продавца, мгновенно становится целью оптимизации продавцов. Метрика Bazaar «уникальные плательщики за 30 дней» была разумной ровно до того дня, когда по ней начали ранжировать. Средняя оценка в ERC-8004 была разумной ровно до того же момента.

Репутация отвечает на вопрос «хорош ли сервис вообще». Покупателю нужен ответ на вопрос «хорош ли он для моей задачи, в моём формате, на моих объёмах, сегодня». Провайдер, отличный на коротких фактических запросах, может разваливаться на многошаговых.

Провайдер, вчера бывший лучшим, сегодня деградировал под нагрузкой. Это контекстное и изменчивое знание — усреднённая цифра его не отражает.

Отсюда сомнительный вывод: самое надёжное для покупателя — иметь свой собственный валидатор ресурсов.

Сомнительный он потому, что усложняет архитектуру агентов и их взаимодействия с миром.

К сожалению, общий рейтинг или отраслевой скоринг могут плохо подходить для конкретных целей агента.

И приватность здесь не паранойя, а свойство защиты. Публичный критерий можно изучить и оптимизировать под него, ничего не улучшив по сути.

Критерий, которого продавец не видит, накрутить нельзя — можно только действительно хорошо выполнить работу.

Это единственное, что реально будет работать в пользу покупателя.

402Pilot: первая постановка задачи

И вот здесь появляется ещё одна свежая работа: команда HKUST (Guangzhou) с соавторами из MOVENSYS, Schneider Electric и TUM в начале августа 2026 года выложила 402Pilot — не протокол и не кошелёк, а попытка описать слой принятия решений на стороне покупателя.

x402 отвечает на вопрос «как перевести деньги».

402Pilot — на вопрос «кому и сколько».

Задачу авторы определяют пятью условиями одновременно:

  1. баланс кошелька конечен и деньги действительно кончаются;
  2. платёж необратим и происходит до получения результата;
  3. обратная связь только после результата;
  4. цены и ответы сервера меняются без предупреждения;
  5. цена узнаётся из чека, а не из прейскуранта.

Именно набор из пяти условий отличает это от роутинга моделей. FrugalGPT, RouteLLM, OpenRouter, LiteLLM выбирают внутри известного меню с прейскурантом, к которому уже есть доступ по подписке. Никто из них не учится на реально списанной сумме за один вызов.

Устройство 402Pilot:

402Pilot — это decision layer между AI-агентом и x402-платежами, который решает, какому из доступных платных провайдеров отправить конкретный запрос. Он учитывает контекст задачи, цены сервисов, остаток и темп расходования бюджета, после чего политика PA-DCT** выбирает подходящего провайдера; x402 выполняет оплату и запрос, а 402Pilot оценивает полученный результат и его стоимость и использует этот feedback для следующих решений.

Таким образом, система постепенно учится, когда стоит заплатить больше за качество, а когда выбрать дешёвый сервис, одновременно адаптируясь к изменению цен и качества провайдеров.

Для политики выбора провайдера авторы применяют собственный термин PA-DCT (Payment-Aware Discounted Contextual Thompson Sampling)

Политика PA-DCT. Человеческим языком:

Сэмплирование Томпсона. Агент не хранит средние оценки провайдеров. Он хранит «во что верю и насколько не уверен», и перед каждой покупкой вытягивает из своей веры случайную догадку, выбирая лучшую из вытянутых. Провайдер, о котором мало известно, имеет широкий разброс — и время от времени выигрывает жеребьёвку. Так исследование рынка получается само собой, без отдельного бюджета на эксперименты.

Давление кошелька. Система сравнивает фактический темп трат с линейным планом. Идёшь по плану — цена и качество весят поровну. Жжёшь быстрее — цена начинает перевешивать, дорогие тарифы выпадают из рассмотрения. Экономишь — открывается премиум.

Забывание. Все накопленные наблюдения дисконтируются каждый раунд, включая наблюдения о провайдерах, у которых сейчас не покупают. Побочный эффект оказался главной функцией: провайдер, от которого агент отвернулся, постепенно «забывается» до априорной неопределённости, снова начинает выигрывать жеребьёвки — и агент замечает, что упавший сервис починился. Без этого механизма отказ был бы приговором навсегда.

Отдельно стоит бенчмарк 402Pilot-Bench: 823 задачи из HumanEval, HotpotQA, TriviaQA и OpenAssistant, пять провайдеров, 20 575 заранее оценённых ответов, три рыночных режима, 30 парных сидов, 10 000 раундов, кошелёк $50.

Провайдер Цена Что делает
P-cheap $0,0005 Дешёвая модель, посредственное качество
P-mid $0,002 Честный средний тариф
P-premium $0,01 Дорогая модель, лучшее качество
P-adv $0,002 В 60% случаев бегло формулирует неверный ответ
P-flaky $0,002 В 40% случаев биллит таймаут

Три провайдера с одинаковой ценой и одинаковой базовой моделью в прейскуранте неотличимы. Разница видна только после оплаты. В модель заложены ровно те два дефекта, которых нет в прайс-листе и которые не ловит никакая репутационная система: ложное качество и оплаченная недоставка.

P-adv — это, по сути, экономическая модель атаки на выбор сервиса из предыдущего раздела.

К сожалению, в спокойном рынке обучение проигрывает тупой стратегии «всегда бери средний тариф». Обучение окупается только там, где рынок меняется: провайдер сломался, цена упала, качество поехало.

Чего 402Pilot не решает

Список ограничений авторы дают сами:

  • Живого трафика нет. Все цифры — воспроизведение по кэшу заранее сгенерированных ответов.
  • Discovery считается решённым. Список кандидатов и котировки приходят снаружи. Откуда они и можно ли верить метаданным — вне работы.
  • Продавцы не стратегические. Цены выставлены, никто не подстраивается под покупателя, торга и аукционов нет.
  • Нет ретраев. Один выстрел за раунд. Каскада «купи дешёвого → проверь → эскалируй» в модели нет, хотя в реальности именно повторная попытка после плохого ответа съедает бюджет.
  • Оценка качества бесплатна и мгновенна. В бенчмарке судья закэширован. В проде LLM-судья — это ещё один платный вызов, иногда дороже самой услуги, а бизнес-результат может проявиться через сутки.

И поверх всего — арифметика объёма. Типичный агентный воркфлоу делает десятки вызовов в день. А медианный продавец на всём рынке заработал за свою жизнь $3,96 — значит, объёма, на котором эта политика буквально обучается, на рынке сегодня просто нет.

Дилемма покупателя

Сведём всё в одну формулировку.

Публичная репутация дешева и потому лжива: 0,27 цента за переставленную оценку, 76 ревьюеров на 29 тысяч отзывов, ни одного пруфа за 98% записей. Метрики каталогов производит продающая сторона: 84,98% расчётов операторы гоняют между своими адресами, 58% «уникальных плательщиков» держат двадцать доменов.

Собственный опыт правдив, но покупается только деньгами — по цене реальной покупки плюс цена проверки. А объёма, на котором этот опыт набирался бы быстро, на рынке нет, потому что покупателей мало.

Мало их в том числе потому, что доверять некому.

Это замкнутый круг, и он же — главная нерешённая задача агентной экономики на сегодня.

Не рельсы: рельсы уже инфраструктура.

Не безопасность фасилитаторов: она чинится аудитами.

А именно сторона покупателя.

Что из этого следует практически

Если вы строите агента-покупателя. Публичные рейтинги можно использовать как одноразовый приор для холодного старта. А минимальная полезная версия 402Pilot собирается за неделю и даёт 90% пользы: дисконтированная оценка «качество на доллар» по паре «провайдер × тип задачи», обучаемая на фактически списанных суммах.

Если вы продаёте агентам. Предсказуемость и качество важнее прайс-листа. Как только на той стороне окажется политика, которая учится на реализованных исходах, оплаченный таймаут станет дороже честного отказа: первый портит вашу оценку у покупателя надолго, второй не стоит ничего. Накрутка каталога приводит первый платёж; второй приводит только результат.

Сегодня накрутка рентабельна ровно потому, что рынок тонкий. Если покупательская сторона вырастет в 10–100 раз — ферма утонет в органическом сигнале и потеряет экономический смысл, а половина «болезней» каталогов вылечится сама.


Источники: