Nivel: ⭐⭐⭐ Explorador
Un desarrollador ha publicado ScreenMind, una herramienta que captura tu pantalla, la analiza con Gemma 4 E2B completamente en local, y construye una memoria de IA buscable.
¿Qué es exactamente ScreenMind?
ScreenMind es un proyecto software libreVer Código Abierto. con licencia MIT que funciona como un asistente de memoria para tu ordenador. Captura tu pantalla cada 40 segundos (pero solo cuando algo cambia de verdad), analiza cada captura con Gemma 4 —el modelo multimodal de Google que corre íntegramente en tu máquina— y guarda toda la información en una base de datos local. Puedes buscar cualquier cosa que hayas hecho, preguntarle «¿qué estaba mirando ayer a las 3?», o incluso hacer que te genere resúmenes automáticos de tu día.
El proyecto se publicó en GitHub y rápidamente llamó la atención en Hacker News precisamente porque hace lo que Microsoft Recall prometía —pero sin enviar tus datos a ningún lado.
Cómo funciona por dentro
ScreenMind usa cuatro modelos de IA trabajando en cadena, todos corriendo en tu ordenador:
- Gemma 4 E2B como cerebro principal: analiza cada captura de pantalla (visión), transcribe notas de voz y reuniones (audio), y responde preguntas sobre tu historial (razonamiento). Un solo modelo hace las tres cosas.
- EasyOCR extrae el texto visible de cada pantalla para dárselo de contexto a Gemma.
- MiniLM-L6-v2 genera vectores semánticosVectores semánticos — representación matemática del significado de un texto en forma de vector (lista de números). Cuanto más cercanos estén dos vectores en el espacio numérico, más relacionados están los conceptos que representan. Los vectores semánticos son el resultado de los modelos de embeddings y permiten buscar información por su significado en lugar de por palabras exactas. Se almacenan en bases de datos vectoriales para búsqueda rápida por similitud.Similar a: Embeddings para búsqueda por significado, no solo por palabras clave.
- FTS5 (el buscador de texto de SQLite) indexa todo para búsquedas instantáneas.
El resultado es que puedes abrir un navegador en http://127.0.0.1:7777 y buscar cosas como «esa conversación sobre presupuestos de la semana pasada» o «¿qué dijo Alex en Discord?» y ScreenMind te responde con el contexto exacto.
Además, incluye transcripción automática de reuniones (detecta Zoom, Teams y Meet), notas de voz con solo pulsar Ctrl+Shift+V, y un sistema de agentes donde puedes crear automatizaciones escribiendo en Markdown o PythonPython — lenguaje de programación versátil y fácil de leer, muy usado en inteligencia artificial, análisis de datos y automatizaciones. En n8n se pueden escribir nodos de código en Python para procesar datos, llamar a APIs o implementar lógica personalizada dentro de los workflows..
La tabla comparativa que importa
ScreenMind no es el único proyecto que intenta hacer esto. Pero la comparación con Microsoft Recall y Screenpipe —otra alternativa software libre— deja claras las diferencias:
| Característica | ScreenMind | Screenpipe | Microsoft Recall |
|---|---|---|---|
| Licencia | MIT (software libreVer Código Abierto. total) | Código disponible (licencia comercial para uso empresarial) | Propietaria |
| Coste | Gratis | Gratis (personal) / Pago (comercial) | Requiere PC Copilot+ de 1000€+ |
| Privacidad | Cero llamadas de red. Cero telemetría. | Local-first, nube opcional | Telemetría opt-in. Datos locales tras el escándalo. |
| Hardware mínimo | GPUGPU (Unidad de Procesamiento Gráfico) — Componente del ordenador diseñado originalmente para procesar gráficos, pero que hoy se usa también para ejecutar modelos de inteligencia artificial. Para IA local con Ollama, una GPU moderna (NVIDIA, AMD o Apple Silicon) acelera enormemente la generación de respuestas. No es estrictamente necesaria, pero sin ella los modelos grandes funcionan muy lento. ≥4GB VRAM (o CPUCPU (Unidad Central de Procesamiento) — El cerebro del ordenador, el chip que ejecuta las instrucciones de los programas. En el contexto de la IA local, la CPU puede ejecutar modelos pequeños aunque lentamente. Para uso ofimático y servidores, una CPU moderna es suficiente para la mayoría de herramientas autoalojadas (Nextcloud, n8n, WordPress).) | 8GB RAMRAM (Memoria de Acceso Aleatorio) — Memoria de corto plazo del ordenador, donde se guardan los datos que se están usando en ese momento. Más RAM permite ejecutar más programas a la vez y, en IA local, usar modelos más grandes. Para un servidor con Nextcloud + n8n + herramientas básicas, 4-8 GB de RAM son suficientes. Para IA local con Ollama, se recomiendan 16 GB o más., CPUCPU (Unidad Central de Procesamiento) — El cerebro del ordenador, el chip que ejecuta las instrucciones de los programas. En el contexto de la IA local, la CPU puede ejecutar modelos pequeños aunque lentamente. Para uso ofimático y servidores, una CPU moderna es suficiente para la mayoría de herramientas autoalojadas (Nextcloud, n8n, WordPress). moderna | NPU 40 TOPS + 16GB RAMRAM (Memoria de Acceso Aleatorio) — Memoria de corto plazo del ordenador, donde se guardan los datos que se están usando en ese momento. Más RAM permite ejecutar más programas a la vez y, en IA local, usar modelos más grandes. Para un servidor con Nextcloud + n8n + herramientas básicas, 4-8 GB de RAM son suficientes. Para IA local con Ollama, se recomiendan 16 GB o más. + BitLocker |
| IA | Gemma 4: visión + audio + razonamiento (un solo modelo) | Múltiples modelos: OCR + Whisper + LLMRed neuronal entrenada con enormes cantidades de texto para procesar y generar lenguaje natural. Son la base de herramientas como ChatGPT, Claude, Gemini y los modelos que puedes ejecutar localmente con Ollama. Un LLM no "piensa": predice la siguiente palabra más probable según el contexto, pero el resultado es sorprendentemente útil para redactar, resumir, analizar y programar. externo | Modelo NPU propietario |
| Plataforma | Windows, macOS, LinuxSistema operativo libre y de código abierto que utiliza el kernel Linux. Es el sistema operativo más usado en servidores (se estima que más del 70% de los servidores web del mundo funcionan con Linux), en dispositivos Android, y cada vez más en ordenadores de escritorio. Distribuciones populares: Ubuntu, Debian, Fedora. Si montas tu propio servidor, casi seguro que usarás Linux. (X11 + Wayland) | Windows, macOS, LinuxSistema operativo libre y de código abierto que utiliza el kernel Linux. Es el sistema operativo más usado en servidores (se estima que más del 70% de los servidores web del mundo funcionan con Linux), en dispositivos Android, y cada vez más en ordenadores de escritorio. Distribuciones populares: Ubuntu, Debian, Fedora. Si montas tu propio servidor, casi seguro que usarás Linux. | Solo Windows 11 (Copilot+) |
| Chat con memoria | Sí: RAGRAG (Generación Aumentada por Recuperación, del inglés Retrieval-Augmented Generation) — técnica que combina la recuperación de información de una base de datos o fuente externa con la generación de texto de un modelo de lenguaje (LLM). En lugar de que el modelo responda solo con lo que sabe de su entrenamiento, consulta primero una base de conocimiento (como una base de datos vectorial) para obtener información relevante y luego genera la respuesta basándose en ella. Es la base de los chatbots que responden sobre documentación propia, FAQs o historial de la empresa. conversacional | No | No |
| Transcripción reuniones | Sí (nativa, sin Whisper) | Basada en Whisper | No |
| CifradoProceso de codificar información para que solo quien tenga la clave pueda leerla. Es la base de la privacidad digital: cuando envías un email, guardas un archivo en la nube o haces una compra online, el cifrado protege tus datos de miradas ajenas. Sin cifrado, cualquier información que viaje por internet podría ser interceptada y leída por terceros. | AES (Fernet) + llavero del SO | Opcional | TPM + BitLocker |
¿Y esto a mí qué me importa como autónomo o PYME?
Aquí van tres razones por las que esto no es solo un juguete de desarrolladores:
1. Tus datos no se van a ningún lado. Literalmente, cero llamadas de red tras descargar el modelo inicial. Si trabajas con información de clientes, presupuestos, o datos sensibles, tener un historial de tu actividad que no depende de la nube de nadie es un seguro de privacidad.
2. No necesitas un ordenador de 2000€. Mientras Microsoft Recall exige un PC Copilot+ con chip dedicado (40 TOPS de NPU, 16GB de RAMRAM (Memoria de Acceso Aleatorio) — Memoria de corto plazo del ordenador, donde se guardan los datos que se están usando en ese momento. Más RAM permite ejecutar más programas a la vez y, en IA local, usar modelos más grandes. Para un servidor con Nextcloud + n8n + herramientas básicas, 4-8 GB de RAM son suficientes. Para IA local con Ollama, se recomiendan 16 GB o más., BitLocker, Windows Hello…), ScreenMind funciona con cualquier GPUGPU (Unidad de Procesamiento Gráfico) — Componente del ordenador diseñado originalmente para procesar gráficos, pero que hoy se usa también para ejecutar modelos de inteligencia artificial. Para IA local con Ollama, una GPU moderna (NVIDIA, AMD o Apple Silicon) acelera enormemente la generación de respuestas. No es estrictamente necesaria, pero sin ella los modelos grandes funcionan muy lento. de 4GB VRAM. Una GTX 1650 de segunda mano por 80€ vale. En modo Fast analiza cada captura en unos 12 segundos; con una RTX 3060 baja a 3-4 segundos.
3. Puedes buscar por significado. ¿Cuántas veces has pensado «juraría que vi algo sobre X la semana pasada pero no recuerdo dónde»? La búsqueda semántica de ScreenMind entiende lo que quieres decir, no solo las palabras exactas. Y puedes hablar con tu historial como si fuera un asistente.
Los «peros» de la herramienta
Vale, el proyecto mola. Pero hay peros que no podemos ignorar:
El primero: Gemma 4 E2B pesa unos 5GB y necesita una GPUGPU (Unidad de Procesamiento Gráfico) — Componente del ordenador diseñado originalmente para procesar gráficos, pero que hoy se usa también para ejecutar modelos de inteligencia artificial. Para IA local con Ollama, una GPU moderna (NVIDIA, AMD o Apple Silicon) acelera enormemente la generación de respuestas. No es estrictamente necesaria, pero sin ella los modelos grandes funcionan muy lento. decente (aunque nosotros lo hemos probado en algún portátil viejo y correr, corre, eso sí, a nivel de octogenario adormilado). En una máquina sin GPUGPU (Unidad de Procesamiento Gráfico) — Componente del ordenador diseñado originalmente para procesar gráficos, pero que hoy se usa también para ejecutar modelos de inteligencia artificial. Para IA local con Ollama, una GPU moderna (NVIDIA, AMD o Apple Silicon) acelera enormemente la generación de respuestas. No es estrictamente necesaria, pero sin ella los modelos grandes funcionan muy lento., los tiempos de análisis se disparan hasta hacer la herramienta poco práctica para uso continuo. No es para el portátil de empresa cutre de 2019.
El segundo: esto es un proyecto de una sola persona (ayushh0110). No hay empresa detrás, no hay funding, no hay garantía de que el proyecto esté activo dentro de un año. Es software libreVer Código Abierto. y puedes usarlo con total libertad, pero las actualizaciones y el soporte dependen de que un desarrollador mantenga su hobby.
El tercero: Microsoft Recall sigue teniendo un ecosistema que ScreenMind no iguala. Integración nativa con Windows, cifradoProceso de codificar información para que solo quien tenga la clave pueda leerla. Es la base de la privacidad digital: cuando envías un email, guardas un archivo en la nube o haces una compra online, el cifrado protege tus datos de miradas ajenas. Sin cifrado, cualquier información que viaje por internet podría ser interceptada y leída por terceros. TPM, detección de contenido sensible a nivel de sistema operativo… la versión de Microsoft, mal que nos pese, tiene capas de seguridad que una herramienta de terceros no puede replicar al mismo nivel.
Dicho esto: prefiero mil veces una herramienta imperfecta que corre en mi máquina a una perfecta que manda telemetría a Seattle.
Además, ScreenMind incluye detección automática de datos sensibles (tarjetas de crédito, contraseñas, APIConjunto de reglas y protocolos que permite que dos programas se comuniquen entre sí sin intervención humana. Cuando una app le pide datos a otra (por ejemplo, tu CRM pidiendo el clima a una API meteorológica), lo hace a través de una API. Es lo que permite que las automatizaciones y conexiones entre herramientas funcionen. keys), filtro de apps bloqueadas, cifradoProceso de codificar información para que solo quien tenga la clave pueda leerla. Es la base de la privacidad digital: cuando envías un email, guardas un archivo en la nube o haces una compra online, el cifrado protege tus datos de miradas ajenas. Sin cifrado, cualquier información que viaje por internet podría ser interceptada y leída por terceros. AES de las capturas, y un modo incógnito que para la grabación al instante. Para ser un proyecto de una persona, el nivel de madurez es sorprendente.
Cómo probarlo
Si te pica la curiosidad, la instalación es trivial:
pip install screenmind
screenmind
Se abre http://127.0.0.1:7777, descargas el modelo Gemma 4 (~5GB) desde la interfaz, y ya está funcionando. En menos de 10 minutos tienes tu propio historial de pantalla analizado por IA, completamente local, sin que nadie más se entere.
Y si no te convence para uso diario, al menos sirve para reflexionar sobre algo: lo que Microsoft vende como imposible sin su hardware de 1000€, un desarrollador lo ha hecho funcionar en una GPUGPU (Unidad de Procesamiento Gráfico) — Componente del ordenador diseñado originalmente para procesar gráficos, pero que hoy se usa también para ejecutar modelos de inteligencia artificial. Para IA local con Ollama, una GPU moderna (NVIDIA, AMD o Apple Silicon) acelera enormemente la generación de respuestas. No es estrictamente necesaria, pero sin ella los modelos grandes funcionan muy lento. de segunda mano por 80€. Eso, en sí mismo, es una declaración de principios.