Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCP-сервер

Тестирование, бенчмаркинг и аудит автономных ИИ-агентов — методы, стенды, доказательная база

Удалённый MCP-сервер поверх курируемого графа знаний. Любое утверждение, которое он возвращает, привязано к зарегистрированному источнику: инструменты передают утверждения вместе с их цитатами и значением уверенности, так что агент может показать свою работу, а не просто что-то заявлять.

Ничего устанавливать не нужно. Это публичный endpoint со streamable-HTTP:

https://agentreliability.dev/mcp

Подключение к клиенту

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / любой клиент, читающий mcpServers

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

Никаких API-ключей, аккаунтов и авторизации. Только чтение.

Проверьте, что он отвечает, вообще без клиента:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

Инструменты

Восемь, у каждого есть outputSchema, каждый возвращает structuredContent.

инструмент

аргументы

описание

get_overview

Обзор корпуса: что знает этот экземпляр, количество по типам, опубликованные теги, актуальность. Начните здесь, когда вы только появились и ещё не знаете, может ли этот корпус ответить на вопрос.

search

query, limit?

Полнотекстовый поиск по графу знаний. Нечувствителен к диакритике и апострофам, поэтому можно вводить запрос словами пользователя; каждый результат содержит оценку релевантности и поля, которые совпали.

answer

question

Отвечает на вопрос по корпусу. Возвращает утверждения соответствующего объекта с источниками и уверенностью — никогда не некорректный ответ.

get_entity

id

Получает один объект знания по идентификатору, вместе с его утверждениями и источниками, которые цитирует каждое утверждение.

get_topic

tag

Перечисляет объекты знания, несущие заданный тег (темы — это теги, за которыми стоит содержимое).

get_related

id

Соседние объекты по графу: исходящие и входящие связи, каждая с указанием типа связи.

get_sources

object_id?

Весь реестр источников или только источники, цитируемые одним объектом. Используйте его, чтобы оценить корпус, прежде чем доверять ему.

get_latest

limit?

Самые недавние проверенные объекты знаний — сигнал свежести.

Предполагаемый путь: get_overviewsearch или answerget_entityget_related. get_overview нужен потому, что агенту, который только что прибыл, следует узнать возможность этого корпуса до того, как тратить запрос на догадки.

Что находится в корпусе

объекты знаний

38

зарегистрированные источники

31

опубликованные темы

93

тип

объектов

сущность

25

руководство

9

сравнение

2

FAQ

1

глоссарий

1

Тематика: эвалы и бенчмарки (GAIA, AgentBench, Inspect), LLM как судья и его режимы отказов, закон Гонхарта и загрязнение бенчмарков, инжекция отказов (fault injection) и хаос-тестирование, шлюзы согласования и уровни автономии, основанность (grounding) и верность (faithfulness).

Вопросы, на которые он умеет отвечать

  • Как отличить настоящую эвалу от бенчмарка, который мой агент запомнил?

  • Что калибровка значит для судьи-LLM и как её измерить?

  • Какие реальные неполадки выявляет внедрение отказов?

Как на самом деле выглядит ответ

Реальный вызов к активному endpoint — answer с запросом "how do I tell a real eval from benchmark contamination" — возвращает следующий structuredContent, сокращённый:

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

Обратите внимание, что возвращается вместе с нужным набором:уровень доказательности (evidence tier), уверенность, дата последней проверки и источник за объектом — не текст, который агенту приходится разбирать, а поля данных, которые он может использовать в решениях. Агент может отказаться от слабого утверждения или прямо процитировать источник.

Когда корпус не может ответить, answered будет false. Он не фантазирует, и пропущенный вопрос фиксируется — чтобы пробел можно было закрыть.

Машинно-читаемые поверхности

Endpoint MCP — один из нескольких. Тот же corpus доступен как обычные текстовые файлы, которые агент может читать напрямую.

поверхности

что это

/llms.txt

оглавление, в виде text/plain

/llms-full.txt

весь корпус одним файлом

/ai-index.json

все публикуемые этим экземпляром поверхности с их типами содержимого

/api/index.json

один JSON-документ на каждый объект знаний

/api/sources.json

весь реестр источников в полном виде

/.well-known/mcp/server.json

манифест этого сервера

У каждого отдельного объекта знаний есть человекочитаемая страница и машиночитаемая версия по одному и тому же идентификатору, с каноническим URL, одинаковым во всех формах.

Feature:

  • POST только. Все остальные методы возвращают 405 с заголовком Allow: POST, OPTIONS.

  • Лимит запросов: 120 запросов в минуту на одного клиента, учитывается в общем хранилище и публикуется в каждом ответе как RateLimit-Limit, RateLimit-Remaining и RateLimit-Reset (все три доступны через CORS). Сбой включает fail-open: если хранилище доступно, запрос всё равно обрабатывается.

  • **Проблем входной данные приводят к корректной JSON-RPC-ошибке — -32700» для непарсерного тела, -32602` для неизвестного инструмента — никогда не HTML-странице с ошибкой.

  • Размер тела запроса ограничен и проверяется до передачи.

Конфиденциальность

Без учёток, без файлов cookie, без рекламы. Использование измеряется в обобщённом виде: ежегодно меняющиеся хэшированные идентификаторы и храненине 200 дней; сырые IP-адреса никогда не сохраняются. Полная политика: PRIVACY.md.

Происхождение данных

Содержимое знаний имеет лицензию CC-BY-4.0: используйте, цитируйте. Реестр источников открыт именно потому, что любое утверждение можно проверить, а не просто принять на веру get_sources возвращает то, на чём стоит конкретное заявление.

Утверждения несут уровень доказательности и дату last_verified. Там, где доказательства слабее, объект прямо говорит об этом, а не округляет лучше.

Как это устроено

Собран и обслуживается Citarium — открытым языком, который превращает граф знаний в выбора, API, MCP-сервер и файлы, понятные агенту, из одного источника: внешняя оценка, с хранителями и журналом фальсифика взачет (открытыми).

Этот репозиторий — публичная страница сервера: его манифест и документация. Сам корпус расположен здесь: agentreliability.dev.

Tool Schema Changelog

Recent tool additions, removals, and schema changes observed during successful MCP inspections. Dates show when Glama detected each change.

No tool schema history has been recorded yet.

Related MCP Connectors

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    7
    MIT

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server