Cintillo de indicadores económicos Colombia

Pico y Placa Medellín

viernes

7 y 9 

7 y 9

Pico y Placa Medellín

jueves

3 y 6 

3 y 6

Pico y Placa Medellín

miercoles

0 y 2 

0 y 2

Pico y Placa Medellín

martes

1 y 4  

1 y 4

Pico y Placa Medellín

domingo

no

no

Pico y Placa Medellín

sabado

no

no

Pico y Placa Medellín

lunes

5 y 8  

5 y 8

Meta lanza Muse Voice Transcribe, modelo de transcripción de voz en tiempo real que distingue hasta 20 hablantes simultáneos: ¿cómo funciona?

El modelo es capaz de detectar cambios de idioma dentro de una misma frase. Está disponible desde hoy en Meta Model API, Meta AI para Mac y Muse Code.

  • Meta Superintelligence Labs presentó Muse Voice Transcribe, un modelo de transcripción de voz en tiempo real entrenado en más de 70 idiomas que lidera los benchmarks de precisión y velocidad en transcripción en streaming e identificación de hablantes. FOTO cortesía Meta
    Meta Superintelligence Labs presentó Muse Voice Transcribe, un modelo de transcripción de voz en tiempo real entrenado en más de 70 idiomas que lidera los benchmarks de precisión y velocidad en transcripción en streaming e identificación de hablantes. FOTO cortesía Meta
hace 2 horas
bookmark

Meta presentó Muse Voice Transcribe, su primer modelo de IA para percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs.

La herramienta realiza transcripción automática de voz en tiempo real, identifica quién habla en cada momento y detecta el inicio y el fin de cada intervención, todo de forma simultánea y sin procesamiento posterior.

El modelo forma parte de la familia Muse Spark y procesa el audio en fragmentos de 80 milisegundos, equivalentes a 12,5 ciclos por segundo. En cada fragmento, el sistema decide si continúa escuchando o emite texto, lo que le permite ajustar de manera dinámica el tiempo que tarda en transcribir cada palabra según su dificultad.

Según información de su blog oficial, Meta denomina esta función “retraso adaptativo” y la desarrolló mediante aprendizaje por refuerzo, combinando una recompensa por precisión con otra por velocidad.

Según la empresa, Muse Voice Transcribe lidera los rankings de Artificial Analysis en transcripción de voz en streaming y en los principales benchmarks públicos de identificación de hablantes, con una tasa de error de transcripción del 3,1% y una tasa de error de identificación de hablantes del 17,5%.

Un modelo multilingüe

El modelo fue entrenado en más de 70 idiomas, de los cuales 25 han sido ampliamente verificados para su uso en producción. Entre ellos figuran el español, el portugués, el inglés, el alemán, el italiano, el chino mandarín y el árabe.

Una de sus capacidades más destacadas es el manejo nativo del cambio de idioma, conocido técnicamente como code-switching, que permite que un hablante bilingüe alterne entre dos lenguas dentro de una misma oración sin que el sistema pierda precisión.

Además, acepta contexto adicional mediante sesgo por idioma, palabras clave y contexto conversacional, lo que le permite reconocer correctamente términos específicos como nombres propios, marcas o lugares.

La función de identificación de hablantes, llamada “diarización”, permite distinguir en tiempo real hasta 20 participantes en una misma conversación y asignarles etiquetas individuales del tipo “hablante A”, “hablante B”, y así sucesivamente.

El sistema también detecta automáticamente cuándo empieza y cuándo termina cada intervención, lo que facilita su integración en aplicaciones de transcripción de reuniones, asistentes de voz y herramientas de colaboración.

El modelo soporta de forma nativa entradas de audio de larga duración que pueden superar la hora, sin necesidad de procesamiento adicional.

Lea también: ChatGPT Teens: cinco preguntas clave para entender la nueva versión del chatbot para adolescentes

¿Cómo funciona técnicamente?

Para el reconocimiento de cada interlocutor, el modelo introduce tokens especiales que marcan los cambios de hablante y diferencian quién está hablando en cada segmento.

Para la detección de inicio y fin de intervención, usa tokens adicionales que identifican cuándo el usuario empieza a hablar y cuándo termina, lo que permite a los sistemas de inteligencia artificial saber con precisión cuándo responder.

Ambas funciones se entrenan de forma conjunta con la transcripción en streaming, lo que garantiza coherencia entre los tres procesos.

Muse Voice Transcribe está disponible desde hoy a través de tres canales: Meta Model API para desarrolladores, Meta AI para Mac y Muse Code.

Con un solo clic, la dictación por voz en Meta AI y en Muse Code pasa a estar impulsada por este modelo, que puede usarse con cualquier aplicación manteniendo presionada la tecla Fn.

Para consultar contenido prémium o profundizar sobre sus temas de interés de Medellín, Antioquia, Colombia y el mundo, regístrese aquí.

Preguntas frecuentes:

¿Qué es Muse Voice Transcribe y para qué sirve?
Muse Voice Transcribe es el primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs. Realiza transcripción automática de voz en streaming, identifica quién habla en cada momento entre hasta 20 participantes simultáneos, detecta el inicio y fin de cada intervención y soporta más de 70 idiomas con cambio de idioma dentro de una misma frase.
¿Cuántos idiomas soporta Muse Voice Transcribe de Meta?
El modelo fue entrenado en más de 70 idiomas, de los cuales 25 han sido ampliamente verificados para su uso en producción, entre ellos el español, el portugués, el inglés, el alemán, el italiano, el chino mandarín y el árabe. También soporta el cambio de idioma dentro de una misma oración para hablantes bilingües.
¿Dónde está disponible Muse Voice Transcribe?
Muse Voice Transcribe está disponible desde su lanzamiento a través de Meta Model API para desarrolladores, Meta AI para Mac y Muse Code. En Meta AI para Mac y Muse Code, la dictación por voz pasa a estar impulsada automáticamente por este modelo al mantener presionada la tecla Fn.

Nuestros portales

Club intelecto

Club intelecto
Las más leídas

Te recomendamos