web_fetch
Fetches and reads a URL's content, bypassing anti-bot protections for documentation, articles, and code. Extracts clean main text or full HTML with section and pagination options.
Instructions
Obtiene y lee el contenido de una URL mediante el servicio multi-nivel de EnriProxy.
Cuándo usarla:
Cuando necesite leer el contenido completo de una página web.
Cuando necesite acceder a documentación, artículos o archivos de código.
Cuando métodos de fetch más simples fallen por protección anti-bot.
Características:
Detección de APIs de registros de paquetes (npm, PyPI)
Fetch de archivos raw (GitHub raw, HuggingFace)
Fetch robusto para sitios estáticos, dinámicos y protegidos (best-effort)
Respaldo automático entre múltiples estrategias de recuperación (detalles omitidos intencionalmente)
Proyección controlable:
format('text' ligero por defecto, 'markdown' estructura completa, 'html' DOM saneado),content('main' elimina navegación/banners y conserva el artículo),anchor(lee sólo una sección por id o título de encabezado),include_links(inventario de enlaces de la página) einclude_metadata(idioma/autor/fecha/imagen destacada)Decodificación de páginas con encoding legado (windows-1252/ISO-8859-1) sin mojibake
Notas:
Proporcione la URL completa incluyendo protocolo (https://).
El contenido se limita con el parámetro
max_chars(por defecto: 200000).Si el resultado viene truncado e incluye un
cursor, vuelva a llamarweb_fetchconcursor+offset_chars+limit_charspara leer más sin volver a descargar.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| url | No | URL completa a obtener (http:// o https://). | |
| limit | No | Alias legado de limit_chars. Límite de lectura por cursor en caracteres (por defecto: max_chars). | |
| anchor | No | Selector de sección: id de un elemento (con o sin '#', ej. 'installation') o texto exacto de un encabezado (ej. 'Instalación'). Devuelve sólo esa sección hasta el siguiente encabezado del mismo nivel o superior. Mucho más barato que paginar con offset_chars a ciegas en documentos largos. Si la sección no existe, la respuesta lo indica y devuelve el documento completo. | |
| cursor | No | Cursor opaco devuelto por una llamada previa de `web_fetch` para paginación. Nunca invente este valor. | |
| format | No | Formato del contenido para páginas HTML. 'text' (por defecto) devuelve texto estructurado ligero y gasta menos tokens. 'markdown' reproduce la estructura exacta de la página: enlaces con URL, énfasis, bloques de código, listas anidadas, imágenes y tablas. 'html' devuelve el marcado HTML saneado (sin scripts/estilos) para inspeccionar el DOM: formularios, atributos data-*, estructura de componentes. Para preguntas puntuales (versiones, precios, datos sueltos) deje el formato por defecto. | |
| offset | No | Alias legado de offset_chars. Offset de lectura por cursor en caracteres (por defecto: 0). | |
| prompt | No | Pista opcional que describe qué desea extraer (la herramienta devuelve el contenido obtenido; no genera un resumen con IA). | |
| content | No | Alcance del contenido HTML. 'full' (por defecto) devuelve toda la página, incluida navegación, encabezados y pie. Use 'main' para quedarse sólo con el contenido principal (contenedor article/main, sin menús, barras laterales, banners de cookies ni pies): ahorra típicamente 60-80% de tokens en artículos, documentación y blogs. Combine content='main' con format='markdown' para la lectura óptima de artículos largos. | |
| max_chars | No | Longitud máxima del contenido (por defecto: 200000). | |
| limit_chars | No | Límite de lectura por cursor en caracteres (por defecto: max_chars). Prefiera este nombre actual de campo de EnriProxy sobre limit. | |
| offset_chars | No | Offset de lectura por cursor en caracteres (por defecto: 0). Prefiera este nombre actual de campo de EnriProxy sobre offset. | |
| include_links | No | Si es true, agrega al final un inventario ENLACES DE LA PÁGINA con todos los enlaces únicos (etiqueta y URL, hasta 200). Úselo para decidir a dónde navegar después (crawling informado), descargar documentos enlazados o pasar URLs de imágenes a una herramienta de análisis de media que acepte URLs http(s) directas. | |
| include_metadata | No | Si es true, agrega al final un bloque METADATOS DE LA PÁGINA con idioma, autor, fecha de publicación e imagen destacada (og:image). Útil para citar fuentes o decidir frescura del contenido antes de gastar tokens en el fetch completo. |