Исследования · Разбор случая · 6 сентября 2026
WhoFollows: как дать агенту ограниченный доступ к проверяемым результатам
Может ли простой интерфейс только для чтения помочь агенту точнее объяснять изменения, если за вычисление фактов отвечает само приложение?
WhoFollows сравнивает предоставленные пользователем списки подписчиков и подписок. Для WebMCP Challenge мы добавили в существующий продукт экспериментальный интерфейс для агентов. Подача была подтверждена 3 сентября; 4 сентября организаторы объявили о закрытии приёма заявок. Участие не означает награды или одобрения.
Проблема
Число подписок может остаться прежним, хотя сам список изменился. WhoFollows сохраняет версии списков и вычисляет различия по фиксированным правилам. Но по изменению списка нельзя узнать, почему человек подписался или отписался.
Наша гипотеза
Мы предполагаем, что агент будет точнее передавать факты и реже придумывать объяснения, если получит структурированный результат через инструмент с чётко ограниченной задачей. Приложение вычисляет изменения, а агент рассказывает о них. WebMCP — дополнительный интерфейс только для чтения. В нём нет встроенной языковой модели или самостоятельного доступа к Instagram.
Что удалось показать
Демонстрация использует два синтетических снимка списка подписок для @demo.profile. При документированной успешной проверке 3 сентября зафиксирован вызов get_latest_changes и следующий результат:
| Показатель | Результат |
|---|---|
| Добавлен | @new.account |
| Удалён | @older.account |
| Без изменений | 3 аккаунта |
| Количество подписок | 4 → 4 |
Демонстрация показывает, что один конкретный сценарий работает: агент вызывает инструмент приложения и получает результат сравнения. Более ранний запуск, в котором агент показал верные изменения без вызова WebMCP, не считается подтверждением интеграции.
Ограничение: это описание опирается на сохранённую историю проверки, а не на новое независимое повторение. Чтобы другой исследователь мог воспроизвести результат, нужны запись вызова и точная версия демонстрации.
Каких выводов пока делать нельзя
Демонстрация не доказывает, что интерфейс совместим со всеми браузерами и агентами, стабильно работает при повторных запусках, безопасен во всех частях продукта или лучше обычного интерфейса. Она также не подтверждает полноту реальных пользовательских списков. Предположения о снижении тревожности и улучшении удобства пока не проверены.
Мы не заявляем о скрейпинге, автономном доступе к Instagram, управлении аккаунтом или знании причин подписки и отписки. Пример содержит синтетические данные. Один инструмент только для чтения не доказывает полную приватность системы.
Что проверим дальше
Сначала сохранить конкурсную версию, синтетические входные данные, ожидаемые результаты и запись реального вызова. Затем провести небольшое парное сравнение с той же моделью в той же среде:
- Доступ к странице: агент читает сравнение на странице без WebMCP.
- Доступ через инструмент: агент получает тот же результат через
get_latest_changes.
Предлагаемый пилот: 10 заранее заданных синтетических случаев, по 3 независимых запуска каждого в обоих режимах — всего 60 запусков. Включить отсутствие изменений, добавления, удаления, замену при том же количестве и отсутствие предыдущего снимка. Отсутствие истории должно означать «сравнение недоступно», а не «ничего не изменилось».
Измерять фактическую точность, неподтверждённые утверждения и выполнение задачи. Отдельно записывать реальные вызовы, сбрасывать контекст между запусками, чередовать порядок режимов и сохранять неудачи. Одинаковая эффективность тоже информативна. Пилот оценит интерфейс в одной среде; понимание и эмоциональные эффекты требуют отдельного исследования с людьми.
Статус: техническая демонстрация проведена и описана. Сравнительный эксперимент пока только предложен.
Открыть демонстрацию на синтетических данных Репозиторий проекта