{"$schema":"https://wellknown.network/schemas/agent-record-v1.json","schemaVersion":"1","id":"ag_9hx6p3qk4sxn","handle":"realtimex-web-scraping-mcp-server","url":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server","links":{"self":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server/record.json","html":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server","markdown":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server/record.md","api":"https://wellknown.network/api/v1/agents/realtimex-web-scraping-mcp-server","status":"https://wellknown.network/api/v1/agents/realtimex-web-scraping-mcp-server/status","claim":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server/claim","claimApi":"https://wellknown.network/api/v1/claims","claimDescriptor":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server/claim.json","badge":"https://wellknown.network/agents/realtimex-web-scraping-mcp-server/badge.svg","openapi":"https://wellknown.network/openapi.json"},"ard":{"identifier":"urn:air::server:realtimex-web-scraping-mcp-server","type":"application/mcp-server-card+json"},"kind":"mcp_server","declared":{"name":"realtimex-web-scraping-mcp-server","summary":"A Model Context Protocol (MCP) server for web scraping using Crawl4AI","description":"# Web Scraping MCP Server\n\nA Model Context Protocol (MCP) server that provides utility tools for web scraping using Crawl4AI as the core engine. Supports multiple extraction modes including markdown generation, HTML processing, structured data extraction via CSS selectors, and AI-powered semantic analysis.\n\n## Features\n\n- **Multiple Extraction Modes**: Support for markdown, HTML, schema-based, and LLM-powered extraction\n- **Advanced Browser Automation**: Connects to a browser via CDP for full control, with proxy support and stealth features\n- **Structured Output**: Returns structured JSON data for programmatic consumption\n- **Session Management**: Persistent sessions for multi-step workflows\n- **Comprehensive Error Handling**: Robust error handling with detailed error information\n- **Type Safety**: Full type hints and Pydantic validation\n- **Cost-Aware LLM Usage**: Smart LLM usage with budget controls and caching\n\n## Supported Extraction Modes\n\n### 1. Markdown Extraction (`markdown`)\n- **Use Case**: Clean content extraction for analysis and documentation\n- **Output**: Clean markdown with citations and structured formatting\n- **Best For**: Articles, blog posts, documentation\n\n### 2. HTML Extraction (`html`)\n- **Variants**: Clean HTML or raw HTML\n- **Use Case**: HTML processing and structure analysis\n- **Best For**: Template extraction, HTML analysis\n\n### 3. Schema-Based Extraction (`schema`)\n- **Use Case**: Structured data extraction using CSS selectors\n- **Output**: JSON array of extracted objects\n- **Best For**: Product catalogs, data tables, listings\n\n### 4. LLM-Powered Extraction (`llm`)\n- **Use Case**: AI-powered semantic extraction and analysis\n- **Output**: Structured JSON or text based on instructions\n- **Best For**: Content analysis, sentiment extraction, complex reasoning\n\n## Quick Start\n\n### Installation\n\n```bash\n# Install via pip\npip install web-scraping-mcp-server\n\n# Or use with uvx (no installation required)\nuvx web-scraping-mcp-server\n```\n\n### Bootstr…","publisher":null,"homepage":null,"repository":null,"version":"0.1.0","license":"MIT","protocols":["mcp"],"tags":["automation","crawl4ai","data-extraction","mcp","web-scraping"],"pricing":null,"endpoints":[{"url":"pypi:realtimex-web-scraping-mcp-server","type":"package_pypi","auth":null,"probeable":false}],"skills":null,"tools":null,"extra":null,"attribution":{"kind":"pypi","name":"pypi","license":"pypi","summary":"pypi","version":"pypi","description":"pypi"}},"derived":{"capabilities":[{"slug":"documents.extraction","name":"Data Extraction","confidence":1,"provenance":"derived"},{"slug":"data.web-scraping","name":"Web Scraping","confidence":1,"provenance":"declared"},{"slug":"infra.browser-automation","name":"Browser Automation","confidence":0.859,"provenance":"derived"}],"categories":["data","documents","infra"],"language":"en"},"observed":{"status":"unknown","statusReason":"Distributed as a package to run locally; no network endpoint to check.","lastOkAt":null,"lastProbedAt":null,"statusComputedAt":null,"reliability30d":null,"latestObservations":[],"tools":null,"package":{"name":"realtimex-web-scraping-mcp-server","registry":"pypi","observedAt":"2026-09-10T11:28:13.219Z","publishedAt":"2025-11-18T08:37:49.860535Z","latestVersion":"0.1.0"}},"verification":{"claimed":false,"claimedAt":null,"proofs":[]},"provenance":{"sources":[{"source":"pypi","key":"realtimex-web-scraping-mcp-server","url":"https://pypi.org/project/realtimex-web-scraping-mcp-server/","firstSeenAt":"2026-09-10T11:26:13.841Z","fetchedAt":"2026-09-10T11:26:13.841Z","normalizedAt":"2026-09-10T11:26:13.841Z"}]},"firstSeenAt":"2026-09-10T11:26:13.841Z","updatedAt":"2026-09-10T11:28:13.219Z"}