Terminas una frase y no pasa nada. Pasa un segundo, quizá dos, y entonces el teléfono habla. Esa pausa no es lag de red, ni el modelo de traducción yendo lento. En la mayoría de las apps es una decisión de diseño deliberada, y saber qué decisión tomó una app te dice más sobre cómo se va a sentir que cualquier puntuación de precisión.
Aquí va la respuesta clara. Todo traductor de voz funciona en cuatro etapas: capturar tu voz, convertirla en texto, traducir el texto, pronunciar el resultado. La pausa que sientes viene de la etapa 2 — la mayoría de las apps esperan alrededor de un segundo de silencio antes de decidir que has terminado. Apps como el modo conversación de Google Translate trabajan por turnos y aceptan la pausa. Las apps de traducción continua como OmniTalk traducen mientras aún hablas y lo pagan en revisiones visibles. Ninguna es instantánea: de dos a cuatro segundos por detrás de quien habla sin parar es el mejor caso realista, el mismo desfase con el que trabaja un intérprete humano. El resto del artículo explica adónde va cada uno de esos segundos.
Todo traductor de voz en iPhone ejecuta las mismas cuatro etapas. Lo que las separa es si esas etapas pueden solaparse o no.
| Etapa | Qué ocurre | ¿Puede empezar antes de que dejes de hablar? |
|---|---|---|
| 1. Captura | El audio del micrófono se almacena en búfer y se convierte al formato que quiere el reconocedor | Siempre |
| 2. Reconocimiento | El audio se convierte en texto | Depende de la app |
| 3. Traducción | El texto se convierte en texto en otro idioma | Depende de la etapa 2 |
| 4. Voz de salida | El texto traducido se convierte en audio | Depende de la etapa 3 |
Una app que ejecuta las etapas 2 a 4 estrictamente en secuencia, después de que te calles, no puede ser rápida por buenos que sean sus modelos. Una app que las solapa empieza a traducir a mitad de frase, y lo paga en otra moneda: revisiones.
Etapa 1: la captura, y por qué el micrófono importa más de lo que crees
El reconocedor no recibe "tu voz". Recibe un flujo de búferes de audio a una frecuencia de muestreo fija, y la calidad de ese flujo pone un techo duro a todo lo que viene después.
Con el micrófono del propio iPhone esto no tiene interés: obtienes audio de banda ancha y el techo es alto. Se vuelve interesante en cuanto entra el Bluetooth. Cuando una app abre el micrófono de unos auriculares Bluetooth, iOS cambia toda la conexión de A2DP, el perfil unidireccional de alta calidad, a HFP, el perfil bidireccional de llamada. Ambas direcciones caen a calidad de llamada a la vez. No existe combinación de ajustes que dé a una app buen micrófono y buena reproducción a la vez en los mismos auriculares.
Esa restricción condiciona todas las funciones de traducción con auriculares de la plataforma, y la explicamos en detalle, con la declaración de la propia Apple, en la comparativa de AirPods.
Consecuencia práctica: un traductor de voz probado con el micrófono del teléfono y un traductor de voz probado a través de auriculares no son la misma prueba. La tasa de errores de reconocimiento sube de forma medible con audio de banda estrecha, y ninguna calidad de traducción recupera una palabra que el reconocedor nunca oyó.
Etapa 2: el reconocimiento, y el problema del fin de frase
De aquí viene la pausa.
El reconocimiento de voz tiene que decidir cuándo has terminado de hablar. Esa decisión se llama detección de fin de frase (endpoint detection), y la implementación habitual es un temporizador de silencio: tras unos 700 a 1.000 milisegundos sin habla, el reconocedor declara la frase completa y emite una transcripción final. Solo entonces una app por turnos pasa a la etapa 3.
El modo conversación de Google Translate es explícito en que funciona así. Las instrucciones de la propia Google son «Take turns speaking» — hablad por turnos —, y el micrófono «automatically detects when one language stops and the other language starts» — detecta automáticamente cuándo un idioma para y el otro empieza (ayuda de Google Translate, consultada el 12 de agosto de 2026). Es un buen detector de turnos. Pero sigue siendo un detector de turnos, y detectar turnos significa esperar el silencio por definición.
La alternativa es usar los resultados parciales que el reconocedor ya está produciendo. El framework Speech de Apple lo expone directamente: los resultados llegan como un AsyncSequence en lugar de una sola llamada al final, y la API distingue entre resultados volátiles, que el reconocedor puede revisar, y finalizados (SpeechAnalyzer, consultado el 12 de agosto de 2026). El framework ofrece incluso un paso de precalentamiento, prepareToAnalyze, que según Apple «may improve how quickly the modules return their first results» — puede acelerar los primeros resultados.
Una app construida sobre resultados volátiles puede empujar texto a la etapa 3 unos 200 a 400 milisegundos después de que digas una palabra, en lugar de un segundo después de que pares. La ficha de OmniTalk en la App Store describe el efecto buscado: «Translations appear the moment you speak, built for real conversations, not sentence-by-sentence waiting» — las traducciones aparecen en el momento en que hablas, sin esperar frase a frase.
Por qué cuesta tiempo: el temporizador de silencio no es un fallo que se pueda ajustar hasta hacerlo desaparecer. Acórtalo y el reconocedor corta a la gente a mitad de idea, porque el habla natural contiene pausas de más de 500 milisegundos. Alárgalo y cada intercambio gana un segundo. Las apps por turnos se sitúan en el punto menos malo de esa curva.
Simultánea frente a consecutiva, prestado de los intérpretes humanos
La distinción tiene un siglo de vocabulario profesional detrás, y encaja con las apps con precisión.
Interpretación consecutiva. El hablante habla, para, y el intérprete traduce lo dicho. El tiempo total es aproximadamente el doble del discurso original, porque nada se solapa. Esto es lo que hace una app por turnos.
Interpretación simultánea. El intérprete habla de forma continua, dos a cuatro segundos por detrás del orador, y nunca pide a nadie que pare. Los intérpretes de conferencias trabajan así, en parejas, en cabinas, en turnos de 30 minutos, porque la carga cognitiva es severa. Esto es lo que aproxima una app de traducción continua.
La razón por la que ser intérprete simultáneo agota y contratarlo cuesta caro es exactamente la razón por la que es difícil de construir: hay que comprometerse con una salida antes de que la entrada esté completa, y a veces el final de la frase demuestra que estabas equivocado.
Etapa 3: la traducción, y por qué las frases a medias son un problema más difícil
Traducir una frase completa es un problema suficientemente resuelto. Traducir la primera mitad de una no lo es, y la dificultad es gramatical, no computacional.
El alemán pone el verbo de la subordinada al final. El japonés es sujeto-objeto-verbo y marca la negación en el verbo. El turco apila significado en sufijos. En los tres, la última palabra puede invertir la frase. Un sistema que empieza a traducir pronto se encuentra una y otra vez en la posición de que la salida correcta depende de una palabra que aún no se ha pronunciado.
Solo hay tres respuestas, y cada diseño de traducción continua elige una:
- Esperar contexto suficiente. Retener la salida hasta que un límite sintáctico parezca seguro. Preciso, y reintroduce parte del retraso que intentabas eliminar.
- Comprometerse y revisar. Emitir la mejor conjetura y reescribirla en pantalla cuando las palabras posteriores la contradicen. Rápido, y produce texto que cambia a la vista.
- Comprometerse y no revisar. Lo más rápido, y se equivoca lo bastante a menudo como para ser peligroso con las negaciones.
Lee esa lista frente a lo que ves en pantalla y puedes identificar la estrategia de cualquier app en una conversación. Texto que aparece y luego cambia en silencio es la estrategia 2. Texto que aparece en cláusulas completas, con algo de retraso, es la estrategia 1.
La consecuencia medible: el comportamiento de revisión es la razón por la que dos apps con la misma precisión de benchmark se sienten distintas. Los benchmarks puntúan la cadena final. Los usuarios viven las intermedias.
Etapa 4: la voz de salida
La síntesis de voz añade latencia en dos sitios que suelen confundirse entre sí.
El primero es el tiempo hasta el primer audio: cuánto tarda la voz en empezar a hablar después de recibir el texto. Las voces pequeñas en el dispositivo arrancan casi de inmediato. Las voces neuronales de más calidad suelen sintetizarse en el servidor, lo que añade un viaje de ida y vuelta, y algunas implementaciones sintetizan la frase entera antes de reproducir nada, así que una frase larga tarda más en arrancar que una corta.
El segundo es la duración del propio habla. Una frase traducida tarda en decirse lo que tarda en decirse una frase. Ninguna arquitectura lo elimina, y por eso la traducción manos libres con auriculares de alguien que habla rápido se va quedando atrás: la cola de audio crece más deprisa de lo que se vacía.
Un detalle que conviene saber: pronunciar la misma frase dos veces no suele costar nada la segunda vez, porque el audio sintetizado se guarda en caché. Las apps que miden las voces premium por duración de audio generalmente solo cobran la primera reproducción. Las repeticiones son gratis.
Hay aquí un efecto de segundo orden que aparece en sitios ruidosos: si la otra persona no oye el teléfono, la solución es repetir la reproducción, no repetirte tú, porque una repetición no cuesta reconocimiento, ni traducción, ni tiempo de voz medido.
En el dispositivo o en la nube: qué compra cada uno de verdad
La línea suele trazarse como una cuestión de privacidad. También es una cuestión de latencia y de cobertura, y el trato es más afilado de lo que sugiere el marketing de ambos lados. Escribimos un explicador completo sobre qué significa de verdad la traducción en el dispositivo; la versión corta sigue.
El framework Translation de Apple no deja dudas sobre dónde ocurre el trabajo: «All translations using the TranslationSession class are processed on the user's device. Apple may collect API usage and performance metrics including the app bundle ID and the original and translated language, but this data does not include the original or translated content» — todas las traducciones se procesan en el dispositivo del usuario, y las métricas que Apple recoge no incluyen el contenido (TranslationSession, consultado el 12 de agosto de 2026).
La pega es la disponibilidad, y la API de voz de Apple la modela explícitamente con dos propiedades separadas. supportedLocales son «the locales that the transcriber can transcribe into, including locales that may not be installed but are downloadable» — los idiomas que se pueden transcribir, incluidos los descargables aún no instalados. installedLocales cuenta «only locales that are installed on the device» — solo los instalados en el dispositivo (SpeechTranscriber, consultado el 12 de agosto de 2026).
Esos dos números rara vez coinciden, y de ahí sale un fallo muy concreto y muy común: una app lista un idioma, subes a un avión, y deja de funcionar. El idioma estaba admitido pero nunca se descargó. Los paquetes de reconocimiento y los de traducción son además descargas separadas, así que un par puede estar instalado a medias y fallar en una sola dirección.
| En el dispositivo | En la nube | |
|---|---|---|
| Suelo de latencia | Sin viaje de red | Ida y vuelta por petición, variable con datos móviles |
| Funciona en modo avión | Sí, una vez descargado | No |
| Cobertura de idiomas | Menor, y condicionada a las descargas | Mayor |
| El audio sale del dispositivo | No | Sí |
| Comportamiento con mala señal | Sin cambios | Se degrada o se atasca |
Cómo comprobar tu propio teléfono antes de viajar: descarga el par, activa el modo avión y haz un intercambio completo en ambas direcciones. Es la única prueba que distingue «admitido» de «instalado», y lleva alrededor de un minuto.
Adónde se va el tiempo de verdad
Cifras aproximadas para un intercambio corto con buena conexión, para ver qué etapas merece la pena optimizar.
| Etapa | Por turnos | Traducción continua |
|---|---|---|
| Espera del temporizador de silencio | 700 a 1.000 ms | 0, la salida ya ha empezado |
| Finalización del reconocimiento | 100 a 300 ms | solapada con el habla |
| Traducción | 100 a 400 ms en la nube, menos en el dispositivo | solapada, por fragmentos |
| Tiempo hasta el primer audio hablado | 200 a 800 ms según la voz | 200 a 800 ms |
El temporizador de fin de frase es el mayor coste fijo, y el único que otra arquitectura elimina del todo en lugar de acortar. Todo lo demás es cuestión de cientos de milisegundos. Por eso la diferencia percibida entre apps por turnos y apps de traducción continua es mucho mayor que su diferencia en calidad de modelo.
Cómo medir cualquier traductor tú mismo
Cuatro mediciones, un cronómetro y unos diez minutos. Hazlo con la app que ya tienes antes de instalar otra.
- Tiempo hasta el primer texto. Di una frase de unas ocho palabras. Empieza a cronometrar en tu última sílaba. Para cuando aparezca el primer texto traducido. Esto aísla el temporizador de fin de frase.
- Tiempo hasta el primer audio. La misma frase, para el cronómetro cuando empiece la voz. La diferencia con la medición 1 es tu coste de síntesis de voz.
- La prueba de la interrupción. Di una frase con una pausa deliberada de 1,5 segundos en medio: «Necesito un médico... no una farmacia». Una app por turnos normalmente lo tratará como dos frases y puede traducir la segunda como un fragmento suelto. Este es el modo de fallo con consecuencias reales.
- La prueba de la revisión. Mira la pantalla, no el reloj, mientras dices una frase cuyo sentido depende de la última palabra. Anota si el texto mostrado cambia después de aparecer.
Repite las cuatro en modo avión. Cualquier app que se comporte distinto está usando la red para algo que no te contó.
Qué se rompe, en todas las apps probadas
La negación. La clase de fallo con más consecuencias, y peor en los diseños de traducción continua por la razón estructural de arriba. «Ella no es alérgica a la penicilina, pero yo sí» es una frase donde perder la negación y cambiar el sujeto son errores plausibles y peligrosos los dos. Nuestra regla para todo lo médico: dilo en dos frases cortas, y lee la pantalla en vez de fiarte del audio.
Los números dichos de forma natural. «Las cuatro y media» y «las seis menos cuarto» sobreviven mucho menos que «16:30». Horas, precios y dosis merecen confirmarse en pantalla, no de oído.
Cambiar de idioma a mitad de frase. Un nombre propio en otro idioma dentro de una frase tiende a traducirse cuando no debería, o a transcribirse fonéticamente como un sinsentido. Los nombres de personas y de lugares son la víctima habitual.
La autocorrección. «Perdón, quería decir mañana, no hoy» produce con frecuencia dos frases traducidas contradictorias en lugar de una corregida, porque el reconocedor finalizó la primera cláusula antes de que llegara la corrección.
Qué cuesta el diseño de traducción continua
Comprometerse pronto tiene un precio real, y OmniTalk lo paga en tres sitios.
Revisión visible. El texto que se actualiza mientras hablas desconcierta la primera vez, y en idiomas con verbo al final se actualiza más. Una app que espera parece más tranquila, porque esconde la incertidumbre en lugar de mostrarla. Nosotros la mostramos, lo cual es honesto y a ratos molesto.
Ninguna ventaja en frases cortas. Para un «¿cuánto cuesta esto?» el temporizador de fin de frase apenas importa. Las apps por turnos son perfectamente buenas en intercambios transaccionales de una sola frase, que es una parte grande de lo que los viajeros hacen de verdad.
Nada es gratis. Live Translation de Apple viene integrada en el sistema en el hardware compatible sin coste, y si tienes un iPhone apto con Apple Intelligence activada y AirPods compatibles, es lo primero que probar. Ya cubrimos exactamente qué hace y qué no, y sigue siendo cierto.
Preguntas frecuentes
¿La traducción en tiempo real es de verdad simultánea?
No. Incluso el diseño de traducción continua más rápido va por detrás del hablante, igual que un intérprete simultáneo humano. El objetivo realista es ir de dos a cuatro segundos por detrás del habla continua, no cero.
¿Por qué mi traductor me corta a mitad de frase?
Su temporizador de fin de frase venció durante una pausa natural. Hablar en frases completas más cortas lo evita. También lo evita una app que no dependa de detectar silencio.
¿La traducción en el dispositivo funciona sin nada de internet?
Solo después de descargar el idioma, y el reconocimiento y la traducción suelen ser descargas separadas. Compruébalo en modo avión antes de necesitarlo.
¿Una app más grande traduce mejor?
No. Los modelos de idioma sin conexión incluidos dominan el tamaño de la app. Google Translate ocupa 290,2 MiB y Microsoft Translator 25,6 MiB, y esa diferencia es empaquetado, no calidad (fichas de la App Store, consultadas el 12 de agosto de 2026).
¿Por qué empeora cuando uso auriculares?
Abrir el micrófono Bluetooth fuerza todo el enlace a audio de calidad de llamada en ambas direcciones. La precisión del reconocimiento cae con él, y ninguna app puede librarse.
¿Qué enfoque debería elegir?
Por turnos va bien para intercambios transaccionales cortos y es más tranquilo de leer. La traducción continua merece la pena para una conversación de verdad, donde esperar un segundo tras cada frase se acumula en algo que nadie quiere aguantar.
Cifras consultadas el 12 de agosto de 2026. Los tamaños de la App Store están en MiB, tal como los muestra la tienda. Los rangos de latencia son órdenes de magnitud a modo de ilustración, no mediciones de un test controlado; el método de arriba te permite producir las tuyas.
👉 Descargar OmniTalk en el App Store · Funciones de OmniTalk · Preguntas frecuentes de soporte (en inglés)