Dictado para Notion: capturar notas sin escribir
Notion no tiene entrada de voz integrada en el escritorio. Así funciona el dictado para Notion, y cómo el Notes Mode de Contextli convierte lo que dices en notas organizadas.
Da a cada Mode de Contextli tres o cuatro ejemplos de cómo escribes en realidad y, a partir de ahí, cada dictado sale con tu voz. Un recorrido por Email Mode, Messaging Mode y LinkedIn Mode con configuraciones reales.

La mayoría de las herramientas de dictado te entregan un único tono y te piden que te conformes con él. Hablas al micrófono, sale la misma prosa genérica y dedicas los dos minutos siguientes a editarla para que suene como tú. La promesa de la entrada por voz desaparece silenciosamente en la reescritura.
Contextli parte del supuesto opuesto. Cada Mode se puede personalizar con ejemplos de cómo escribes de verdad. Da a Email Mode tres o cuatro correos reales a clientes y, desde ese momento, cada correo dictado se ajusta a esa voz. La misma idea para Messaging Mode, Notes Mode, LinkedIn Mode, Marketing Copy Mode. Este artículo explica cómo funciona, qué darle como entrada y qué esperar a cambio.
Una estimación de 2026 del Email Statistics Report del Radicati Group sitúa al profesional medio en torno a 126 correos enviados y recibidos al día, con perfiles de la alta dirección a menudo por encima de 150 y mandos intermedios entre 100 y 150. Los trabajadores del conocimiento dedican alrededor del 28% de la semana laboral a procesar correo. Es mucho texto pasando por tu voz concreta, y el coste de un mensaje con un tono equivocado es real, sobre todo cuando el destinatario es un cliente o un inversor.
Las herramientas de dictado genéricas resuelven esto mal. Transcriben lo que dijiste, lo formatean un poco y se detienen. Tú sigues teniendo que hacer el trabajo de que suene a ti. Las más modernas han empezado a ajustar el tono según la aplicación, así que un mensaje de Slack sale más corto que un correo. Es un comienzo, no un punto final.
Personalizar un Mode de Contextli con tus propios ejemplos acorta el bucle. Le enseñas al Mode cómo son realmente tus correos a clientes una vez y luego dictas contra eso durante el próximo mes. El Mode hace la reescritura por ti, con tu voz y para el canal en el que estás escribiendo.
El vídeo siguiente muestra cómo funcionan los Modes de Contextli en la práctica, antes de añadir la capa de personalización.
Contextli viene con seis Modes de serie:
La personalización ayuda sobre todo en los cuatro Modes que producen salida formal y sensible al tono: Email Mode, Messaging Mode, LinkedIn Mode y Marketing Copy Mode. Notes Mode se beneficia menos, porque las notas tienden a ser estructurales más que de tono. General Dictation está pensado para no tocar el texto, así que su personalización es intencionadamente limitada.

Los Modes base son el punto de partida. La verdadera ganancia llega cuando los haces tuyos.
Cada Mode se puede personalizar. Da a Email Mode tres o cuatro ejemplos de cómo escribes de verdad a clientes (tu estilo de cierre, la longitud de tus frases, tu apertura preferida) y, desde ese momento, cada correo dictado se ajusta a esa voz. También puedes darle instrucciones concretas: "usa siempre ortografía británica", "no empieces un correo con la palabra Yo", "firma como Junaid, no como Junaid Khalid". Igual para Slack, igual para LinkedIn, igual para cualquier Mode que personalices.
Si activas el reconocimiento de pantalla (desactivado por defecto, tú decides), Contextli puede ver lo que estás mirando al dictar. Estás leyendo el correo de un cliente con tres preguntas. Pulsas la tecla rápida y dices "dile que estoy ocupado mañana y pasado, pero que tendré lo que pide en tres días". Contextli ya sabe el nombre del cliente, tu nombre y las tres preguntas. Redacta la respuesta como lo harías tú, con saludo y firma, respondiendo a cada pregunta en orden. Tú pulsas enviar.
Dos cosas importan en ese flujo. Primero, los ejemplos pesan más que las instrucciones. Decirle a una herramienta "sé profesional" es vago. Mostrarle tres correos profesionales que escribiste el mes pasado es concreto. Segundo, la capa de reconocimiento de pantalla nunca está activa por defecto y el resto de los Modes funcionan sin ella. Quien tenga dudas de privacidad sobre esa capa puede simplemente dejarla apagada y aun así obtener el beneficio de la personalización en el dictado.
La forma más rápida de ver cómo es esto en la práctica es recorrer tres configuraciones concretas.
Elige tres o cuatro correos a clientes recientes de los que te sientas orgulloso. Lo suficientemente largos para mostrar tu ritmo de frase, lo suficientemente cortos para servir como muestra natural. Pégalos en el campo de ejemplos de Email Mode. Después añade instrucciones específicas: "nunca empieces un correo con Yo, usa Un saludo, Junaid como cierre, usa ortografía británica (organise en vez de organize), mantén los párrafos en 2 o 3 frases".
A partir de ese momento, cuando la consultora abre el correo de un cliente y dicta "gracias por la presentación, las tres cosas que me han llamado la atención son la diapositiva de segmentación, la de precios y el calendario, te paso comentarios el jueves", Email Mode produce una respuesta totalmente formada con su voz, con el cierre que indicó y el ritmo de párrafos que le dio como muestra.
La configuración toma unos cinco minutos. La coincidencia de voz se nota desde el primer correo dictado.
Messaging Mode gestiona Slack, pero Slack tiene su propio ritmo. El Slack de ingeniería tiende a ser corto, en minúsculas, con poca puntuación y consciente de los bloques de código. El CTO añade cinco de sus mensajes reales de Slack de la última semana y luego añade instrucciones: "minúsculas por defecto, sin saludos ni cierres tipo correo, no autocapitalizar la primera palabra, mantener mensajes por debajo de tres frases".
Cuando más tarde dicta "dile a jamie que el despliegue está bloqueado por la migración y que el hotfix lo subimos en un PR aparte", Messaging Mode produce un mensaje corto, en minúsculas, que suena a cómo escribe el resto de su equipo, no a un correo formal traducido a Slack.
La voz en LinkedIn es particular. La mayoría de profesionales que publican en LinkedIn tienen un patrón de apertura reconocible, un rango de longitud específico y una forma narrativa habitual. Una marketing manager elige cinco de sus posts con mayor engagement de los últimos seis meses, los pega en el campo de ejemplos de LinkedIn Mode y añade instrucciones: "abre con un momento concreto o un número, sin hashtags, tres o cuatro párrafos cortos, cierra con una sola conclusión clara".
Cuando dicta la idea aproximada de un nuevo post, "quiero escribir sobre cómo redujimos el ramp-up de SDR de doce a siete semanas, la clave fue cambiar el formato de shadowing de la primera semana", LinkedIn Mode lo convierte en un post que abre como abren sus mejores posts, dentro del rango de longitud que indicó y con el tipo de cierre que su audiencia espera.
La idea no es que el post salga listo para publicar. Es que el primer borrador ya está en tu voz, no en una voz genérica de coach de LinkedIn, y el resto del trabajo es edición, no reescritura.
La mayoría de las herramientas modernas han empezado a añadir personalización ligera. Ninguna ofrece entrenamiento por ejemplos a nivel de Mode como Contextli. Las diferencias importan para cualquiera con un volumen de escritura alto en el que la consistencia de voz no es trivial.
| Característica | Contextli | Wispr Flow | Willow Voice | Dictado nativo de Apple |
|---|---|---|---|---|
| Ejemplos de tu escritura pasada por Mode | Sí | No | No | No |
| Instrucciones escritas personalizadas por Mode | Sí | Limitado (diccionario, snippets) | No | No |
| Tono adaptado al canal (correo vs Slack vs LinkedIn) | Sí | Parcial | Parcial (detecta formal/informal) | No |
| Contexto de pantalla (opcional) | Sí, opcional | No | No | No |
| Opción de modelo local | Sí | No | No | Sí (dictado base en dispositivo) |
Wispr Flow permite añadir vocabulario personalizado, snippets e instrucciones para la IA. Eso se acerca más a un diccionario global que a un entrenamiento por ejemplos a nivel de Mode. Willow Voice soporta vocabulario personalizado para términos sectoriales y se adapta a tu forma de escribir con el tiempo. Ambas están bien para lo que hacen, pero ninguna te permite señalar cinco correos pasados y decir "iguala esta voz, en correo, a partir de ahora".

Los ejemplos de personalización son sensibles. El punto es precisamente que son muestras reales de cómo escribes a personas reales. Contextli los trata sobre la misma pila de privacidad que el resto del producto, con tres niveles de control que puedes combinar o usar por separado.
Nivel 1: modelos locales. Tanto la transcripción como el procesamiento contextual pueden ejecutarse en tu propia máquina. Sin internet, la app sigue funcionando. Necesitarás un Mac o un portátil con Windows modernos, no una máquina de hace diez años.
Nivel 2: trae tu propia clave. Aportas la clave de API del proveedor de transcripción y del de IA, y tus datos van desde tu máquina al proveedor directamente. Contextli nunca los ve. Pagas al proveedor directamente.
Nivel 3: desactivar la sincronización en la nube. La sincronización en la nube es lo que te permite usar las mismas notas y los mismos Modes en varios dispositivos. Si la apagas, Contextli no guarda nada en nuestra base de datos. Tus notas transcritas y tus ejemplos de personalización viven como archivos locales en tu máquina, donde puedes inspeccionarlos.
Combina las tres y Contextli no hace una sola petición a nuestros servidores. Eso importa para quien personalice un Mode con correspondencia confidencial de clientes o publicaciones internas de estrategia. Ninguna otra herramienta de dictado que conozcamos ofrece hoy esta combinación.
Algunos límites honestos, porque "personaliza un Mode con ejemplos" es el tipo de frase que invita a prometer de más:
Tres o cuatro muestras reales por Mode suelen bastar para una coincidencia reconocible. Más ayuda, con rendimientos decrecientes a partir de unos diez. La calidad importa más que la cantidad: elige ejemplos que estarías orgulloso de volver a escribir.
El sistema actual es por Mode, no por destinatario. El recurso práctico es usar instrucciones dentro de Email Mode que cubran el caso general y apoyarse en el reconocimiento de pantalla (cuando esté activado) para captar el contexto concreto del cliente desde el hilo del correo.
El plan gratuito incluye 100 créditos al mes sin tarjeta de crédito. Los ejemplos en sí no consumen créditos; los dictados sí.
Sí. Con la sincronización en la nube activada, los ajustes se guardan en nuestra base de datos. Con la sincronización desactivada, los ajustes viven como archivos locales en tu máquina que puedes copiar y respaldar.
No. Está desactivado por defecto. Lo activas tú explícitamente por sesión o por Mode, y puedes dejarlo apagado del todo. Los demás Modes funcionan sin él.
Sí. La capa de personalización funciona igual tanto si la transcripción y el procesamiento ocurren en la nube como si ocurren en tu máquina local. La calidad de la coincidencia de voz depende del modelo subyacente, y conviene reconocerlo.
Usa General Dictation. Es el Mode para salida literal, sin igualar voz, sin reescritura y sin cambios de formato más allá de mayúsculas y puntuación básicas.
El vocabulario personalizado es un diccionario: se asegura de que los nombres propios y los términos del sector se transcriban bien. Los ejemplos personalizados son entrenamiento de voz: se aseguran de que la salida suene a ti, no solo de que las palabras estén bien escritas. Ambos son útiles. Hacen cosas distintas.
Si estás llegando ahora a Contextli, la personalización es uno de los tres pilares que conviene conocer. Los otros dos son la pila de privacidad descrita arriba y la lógica por Mode, que permite que la misma voz produzca la salida adecuada en correo, Slack, LinkedIn y notas personales. Para una vista de conjunto de cómo se conectan los Modes, la guía pilar sobre speech-to-text contextual es el punto de partida. Para el flujo concreto de personalización de Email Mode, el recorrido de Email Mode profundiza en setups para correo a clientes. Para Messaging Mode, la guía de Slack y WhatsApp cubre la coincidencia de tono en canales informales. Y la visión general de Contextli speech-to-text es la ruta más corta hacia el producto.
Elige un Mode en el que escribas más. Para la mayoría es Email Mode. Dedica cinco minutos a pegar tres o cuatro muestras reales y una o dos instrucciones concretas. Úsalo durante una semana. El plan gratuito incluye 100 créditos al mes sin tarjeta de crédito, suficiente para probar la coincidencia de voz a lo largo de una semana normal.
Contextli está disponible para macOS y Windows. Descarga la app y personaliza tu primer Mode hoy.

Junaid Khalid
Founder & CEO
Founder and solopreneur writing about how modern businesses run leaner and faster with AI. I build software that turns everyday work, from capturing thoughts to writing and staying organized, into something effortless, and I share what I learn along the way.
Notion no tiene entrada de voz integrada en el escritorio. Así funciona el dictado para Notion, y cómo el Notes Mode de Contextli convierte lo que dices en notas organizadas.
Una guía de flujo de trabajo sobre la mejor herramienta de voz a texto para consultores: personalización de correos a clientes, Slack interno y el control de privacidad que exige el trabajo confidencial.
La mayoría de listas de mejores apps omite la tarea que todas vuelven lenta: registrar realmente lo que hiciste. Aquí tienes una mirada honesta a las mejores apps de mantenimiento de autos en 2026 y la alternativa de reg