La IA propia de CareCompileCareCompile's own AI/ v0, en desarrollo/ v0, in development

Dicte, reúnase y encuentre lo que se dijo.Dictate, meet, and find what was said.

Vocero dicta, escucha reuniones, las resume en actas y tareas, y responde preguntas sobre lo que se dijo. Lo construimos como dos modelos abiertos en cascada, un oído y un cerebro, que adaptaremos al español de Centroamérica y que corren en equipos propios.

Vocero dictates, listens to meetings, summarizes them into minutes and tasks, and answers questions about what was said. We are building it as two open models in a cascade, an ear and a brain, to be adapted to Central American Spanish and run on our own equipment.

Etapa: en desarrollo, uso interno. El modelo propio aún no está entrenado.
Ejemplo sintético

Animación ilustrativa. No usa su micrófono y no muestra resultados de un modelo.

Arquitectura
Cascada de dos modelosOído (voz a texto) y cerebro (lenguaje)
Idioma objetivo
Español de CentroaméricaMedido país por país, con voseo
Cerebro, objetivo
~8 mil millones de parámetrosCuantizado para caber en ~12 GB
Equipos propios
RTX 3090 y RTX A200024 GB para entrenar, 12 GB para servir
Estado
Nada entrenado todavíaSin cifras de precisión: aún no se han medido
01 / Arquitectura01 / Architecture

Un oído, un cerebro y reglas que se pueden auditar.An ear, a brain, and rules you can audit.

Vocero es una cascada, no un único modelo de audio de punta a punta. Cada pieza tiene su propia métrica y se puede medir, corregir o reemplazar por separado. Los comandos de dictado los aplica un motor de reglas, no un modelo de lenguaje. Las salidas pasan por una verificación contra la transcripción y, al final, por una persona.

Vocero is a cascade, not a single end-to-end audio model. Each part has its own metric and can be measured, fixed or replaced on its own. Dictation commands are applied by a rule engine, not by a language model. Outputs are checked against the transcript and, at the end, by a person.

  1. AudioAudioMicrófono para dictar, o el audio de una reunión.A microphone for dictation, or meeting audio.
  2. Detección de vozVoice activity detectionSepara la voz del silencio antes de transcribir.Separates speech from silence before transcription.
  3. Oído: voz a texto con puntuaciónEar: speech to text with punctuationModelo abierto de reconocimiento de voz, a ajustar con audio regional.An open speech recognition model, to be fine-tuned on regional audio.
  4. Modo dictado: capa de comandosDictation mode: command layerReglas deterministas aplican coma, punto, nueva línea y correcciones. Resultado: texto dictado.Deterministic rules apply comma, period, new line and corrections. Result: dictated text.
  5. Modo reunión: transcripciónMeeting mode: transcriptCon hablantes y marcas de tiempo, más un glosario regional y la lista de asistentes.With speakers and timestamps, plus a regional glossary and the attendee list.
  6. Cerebro: modelo de lenguajeBrain: language modelObjetivo de unos 8 mil millones de parámetros, cuantizado para unos 12 GB. Escribe actas, tareas y respuestas con cita.Target of about 8 billion parameters, quantized for about 12 GB. Writes minutes, tasks and cited answers.
  7. VerificaciónGrounding checkCada nombre, cifra, fecha y decisión debe aparecer en la transcripción; si no, se marca.Every name, number, date and decision must appear in the transcript; otherwise it is flagged.
  8. Revisión humanaHuman reviewUna persona revisa antes de guardar o enviar.A person reviews before anything is saved or sent.
  9. Conjunto de evaluación selladoSealed evaluation setMide cada pieza por separado. Lo custodia alguien que no entrena modelos.Measures each part on its own. Held by someone who does not train models.
Pieza 1Part 1Candidatos

Oído

Ear

Reconocimiento de voz con puntuación automática en reuniones. En dictado, escribe los comandos como etiquetas (<coma>, <nueva_linea>) en lugar de adivinar.

Speech recognition with automatic punctuation in meetings. In dictation, it writes commands as tags (<coma>, <nueva_linea>) instead of guessing.

Pieza 2Part 2Reglas

Capa de comandos

Command layer

Un motor de reglas probado: inserta puntuación, borra o corrige, y todo se puede deshacer. «Entró en coma» no es una coma: solo cuenta como comando en una pausa.

A tested rule engine: inserts punctuation, deletes or corrects, and every action can be undone. "Entró en coma" is not a comma: a word counts as a command only at a pause.

Pieza 3Part 3Candidatos

Cerebro

Brain

Lee la transcripción y devuelve datos estructurados: acta, tareas con responsable y fecha, y respuestas con la marca de tiempo de donde salen.

Reads the transcript and returns structured data: minutes, tasks with owner and due date, and answers with the timestamp they come from.

Pieza 4Part 4Siempre

Verificación y persona

Check and a person

Lo que no coincide con la transcripción se marca, no se presenta como hecho. Vocero asiste; una persona revisa y decide.

Anything that does not match the transcript is flagged, not shown as fact. Vocero assists; a person reviews and decides.

02 / Demostración: dictado02 / Demo: dictation

Hable, y queda escrito.

Comandos de dictado
Se diceEfecto

Lo que Vocero oye

03 / Demostración: reunión03 / Demo: meeting

De la conversación al acta.

Sintético: guion de ejemplo, no es rendimiento medido.

  1. Audioseñal de la reunión
  2. Oídoreconocimiento de voz
  3. Textohablante, tiempo y palabras
  4. Cerebromodelo de lenguaje: acuerdos, tareas, entidades
  5. Actacada punto con su línea de origen

Escuchando00:00

Acta

Qué extrajo

04 / Cómo se entrena04 / How it is trained

Cinco etapas. Cada una con una puerta.Five stages. Each one has a gate.

No entrenamos desde cero: eso requiere miles de GPU. Partimos de modelos abiertos y los ajustamos con datos regionales. Ninguna etapa avanza si no pasa su puerta, y no hay fechas fijas: cada etapa espera a la anterior. Hoy ninguna etapa se ha ejecutado.

We do not train from scratch: that takes thousands of GPUs. We start from open models and adapt them with regional data. No stage moves on until it passes its gate, and there are no fixed dates: each stage waits for the one before. Today no stage has been run.

  1. 0

    Línea base

    Baseline

    Correr los modelos base sin tocar, y el motor de dictado que funciona hoy, sobre el conjunto sellado. Error por país y puntaje de actas: la cifra que hay que superar.

    Run the untouched base models, and the dictation engine running today, on the sealed set. Error per country and minutes scores: the number to beat.

    PuertaGateLínea base escrita, con fecha y versiones exactas de cada modelo.Baseline written down, with the date and exact model versions.
    Pendiente
  2. 1

    Datos

    Data

    Reunir, revisar licencias, limpiar y separar por país. El conjunto de evaluación se aparta y se sella antes de cualquier entrenamiento.

    Collect, check licenses, clean and split by country. The evaluation set is set aside and sealed before any training.

    PuertaGateCada fuente con nota de licencia. Conjunto sellado con huella SHA-256.Every source has a license note. Set sealed with a SHA-256 fingerprint.
    Pendiente
  3. 2

    Oído

    Ear

    Ajuste fino de un modelo abierto de voz con audio regional, mezclado con español general para que no olvide lo que ya sabe.

    Fine-tune an open speech model on regional audio, mixed with general Spanish so it does not forget what it already knows.

    PuertaGateMejor que la línea base en el conjunto sellado, sin empeorar en ningún país, y al menos igual al dictado actual.Better than baseline on the sealed set, not worse in any country, and at least as good as today's dictation.
    Pendiente
  4. 3

    Cerebro

    Brain

    Ajuste por instrucciones (QLoRA) para actas, tareas y respuestas con cita; después, ajuste por preferencias contra invenciones. Preentrenamiento continuo solo si hace falta.

    Instruction tuning (QLoRA) for minutes, tasks and cited answers; then preference tuning against invented content. Continued pretraining only if needed.

    PuertaGateLos revisores lo califican mejor que el modelo base, sin nombres, cifras ni decisiones inventados.Reviewers rate it above the base model, with no invented names, numbers or decisions.
    Pendiente
  5. 4

    Paquete

    Package

    Fusionar los adaptadores, cuantizar y servir en equipos propios, detrás de un interruptor apagado por defecto.

    Merge the adapters, quantize, and serve on our own equipment, behind a switch that is off by default.

    PuertaGateAprobación explícita del responsable del programa para encender el interruptor.Explicit approval from the program lead to turn the switch on.
    Pendiente
05 / Preentrenamiento y datos05 / Pretraining and data

El cuello de botella son los datos regionales.The bottleneck is regional data.

Los conjuntos abiertos de voz en español vienen sobre todo de España, México y Sudamérica. Hay muy poco audio abierto de Centroamérica, y sin él el oído no mejora donde importa. Por eso la mayor parte del trabajo real es reunir datos regionales con consentimiento.

Open Spanish speech sets come mostly from Spain, Mexico and South America. There is very little open Central American audio, and without it the ear will not improve where it matters. That is why most of the real work is collecting consented regional data.

Preentrenamiento continuoContinued pretrainingCPT

Seguir entrenando un modelo ya preentrenado con mucho texto sin etiquetar de la región: documentos públicos, noticias, enciclopedias con licencia. El modelo aprende vocabulario, nombres y giros. No le enseña una tarea. Lo haremos solo si la línea base muestra un vacío de vocabulario que el glosario no resuelve.

Keep training an already pretrained model on a large amount of unlabeled regional text: public documents, news, licensed encyclopedias. The model learns vocabulary, names and turns of phrase. It does not learn a task. We will do it only if the baseline shows a vocabulary gap that the glossary does not fix.

Ajuste finoFine-tuningLoRA / QLoRA

Entrenar con ejemplos etiquetados de la tarea: audio con su transcripción para el oído; transcripción con su acta revisada para el cerebro. Con LoRA solo se entrenan unas matrices pequeñas añadidas al modelo; por eso cabe en una GPU de 24 GB. Un ajuste completo de 8B necesitaría unos 128 GB.

Train on labeled examples of the task: audio with its transcript for the ear; a transcript with its reviewed minutes for the brain. With LoRA only small added matrices are trained, which is why it fits on a 24 GB GPU. A full fine-tune of an 8B model would need about 128 GB.

Qué hace distinto al español de El SalvadorWhat makes Salvadoran Spanish different
  • Voseo: «vos tenés», «decime». Un modelo entrenado con otro español puede «corregirlo» sin pedirlo.Voseo: "vos tenés", "decime". A model trained on other Spanish may "correct" it unasked.
  • Aspiración de la /s/ final: la /s/ al final de sílaba suena como [h], lo que confunde al reconocimiento de voz general.Final /s/ aspiration: syllable-final /s/ sounds like [h], which confuses general speech recognition.
  • Vocabulario local: «pisto», «cipote», «chunche», y nombres de lugares, instituciones y apellidos de la región.Local vocabulary: "pisto", "cipote", "chunche", and regional place names, institutions and family names.
  • Reuniones reales: cambios entre español e inglés, varios hablantes, audio de teléfono.Real meetings: switching between Spanish and English, several speakers, phone-quality audio.
Necesidades de datos para El SalvadorData needs for El Salvador Estimación de planificación
DatoPara quéCantidadOrigen posibleRegla
Audio de entrenamiento con transcripciónAjustar el oído al habla salvadoreña~20 hestimación de planificaciónHablantes que consienten: lectura con guion y habla espontánea; todas las regiones, edades y génerosConsentimiento escrito que dice que el audio entrena un modelo
Audio de prueba selladoMedir sin trampas~3 hestimación de planificaciónHablantes distintos de los de entrenamientoNunca se usa para entrenar; lo guarda un custodio
Clips de dictadoComandos, números, fechas y nombres de la regiónpor definirsegún el guionGuiones que escribimos, leídos por hablantes que consientenMismo consentimiento que el audio de entrenamiento
Texto regionalVocabulario y nombres para el cerebropor definirsolo si la línea base lo pideDocumentos públicos y archivos de noticias cuya licencia lo permitaNota de licencia por fuente; no se extrae de sitios que lo prohíben
Ejemplos estilo reuniónEnseñar a escribir actas, tareas y respuestasmilespara todo el programaReuniones sintéticas que escribimos; reales solo con consentimientoMarcadas como sintéticas; una persona aprueba cada ejemplo
Español generalQue el oído no olvide lo que ya sabeexistenteconjuntos abiertosConjuntos abiertos de voz en españolLicencia revisada y registrada antes de usarlos

Las horas son estimaciones de planificación, no compromisos ni datos ya reunidos. Hoy no se ha grabado ningún audio para este programa.

06 / Datos para El Salvador06 / Data for El Salvador

Ayúdenos a que Vocero entienda cómo se habla en El Salvador.Help Vocero understand how El Salvador speaks.

Buscamos voces y textos de todo el país, aportados con consentimiento y bajo reglas claras. Lo que se aporte sirve solo para construir y evaluar Vocero.

We are looking for voices and texts from across the country, given with consent and under clear rules. What is contributed is used only to build and evaluate Vocero.

Qué necesitamos

What we need

  • Audio leído con guion y habla espontánea, con su transcripción.
  • Voces de todas las regiones, edades y géneros.
  • Textos públicos con licencia clara.
  • Revisores nativos para calificar actas.
  • Scripted and spontaneous speech, with transcripts.
  • Voices from every region, age and gender.
  • Public texts with a clear license.
  • Native reviewers to score minutes.

Quién puede aportar

Who can contribute

  • Instituciones públicas, con textos de dominio público.
  • Universidades: estudiantes y docentes que quieran grabar.
  • Medios de comunicación, con archivos que puedan licenciar.
  • Personas voluntarias mayores de edad.
  • Public institutions, with public-domain texts.
  • Universities: students and staff who want to record.
  • Media outlets, with archives they can license.
  • Adult volunteers.

Cómo se gobierna

How it is governed

  • Consentimiento escrito e informado.
  • Propósito limitado: solo construir y evaluar Vocero.
  • Derecho a retirarse y a que se borren sus datos.
  • Los datos se quedan en equipos propios.
  • Nada se revende.
  • Written, informed consent.
  • Limited purpose: only to build and evaluate Vocero.
  • The right to withdraw and have the data deleted.
  • Data stays on our own equipment.
  • Nothing is resold.

Qué no aceptamos

What we do not accept

  • Datos reales de pacientes.
  • Conversaciones privadas de cualquier persona sin su consentimiento.
  • Grabaciones de menores de edad.
  • Material sin derecho a compartirlo.
  • Real patient data.
  • Anyone's private conversations without their consent.
  • Recordings of minors.
  • Material you have no right to share.

¿Su institución, universidad o medio quiere participar?Would your institution, university or outlet like to take part? Escríbanos por el formulario. Le explicamos el consentimiento y el proceso antes de que se grabe nada.Write to us through the form. We explain the consent and the process before anything is recorded.

07 / Evaluación07 / Evaluation

Vocero-Bench CentroaméricaCentral America.

Un banco de pruebas diseñado para medir dictado, transcripción, actas y respuestas por país, calificado a ciegas y con intervalos de confianza. Está en diseño: no se ha grabado audio, no se ha sellado el conjunto y no se ha calificado ningún modelo.

A benchmark designed to measure dictation, transcription, minutes and answers per country, scored blind and with confidence intervals. It is in design: no audio has been recorded, no set has been sealed and no model has been scored.

Error de palabras
WER = (S + D + I) / N

Sustituciones, borrados e inserciones sobre palabras de referencia, a nivel de corpus. Se publica con y sin tildes.

Error de caracteres
CER

La misma fórmula sobre caracteres. Útil con nombres propios y palabras locales.

Puntuación
F1 = 2PR / (P + R)

Comas, puntos, saltos de línea, y los signos de apertura ¿ y ¡ como clases propias.

Comandos
LCS(ref, hip) / Nref

Precisión de comandos en orden, activaciones falsas y comandos escritos en vez de ejecutados.

Rúbrica de revisores
1 a 5 · κ ≥ 0.70

Dos revisores nativos por país, a ciegas: completitud, exactitud, utilidad y registro. Los desacuerdos se publican.

Alucinaciones
k de n, cota 95%

Cualquier nombre, cifra o decisión que no esté en la transcripción. Nunca decimos «cero».

  • Conjunto sellado80% de prueba sellada y 20% de desarrollo público, separados por hablante y por reunión.
  • Custodio independienteUna persona que no entrena modelos guarda el audio de prueba. Quien entrena nunca lo ve; solo recibe resultados agregados por país.
  • Huella públicaCada archivo tiene su SHA-256; la huella del manifiesto identifica el conjunto y se publica antes de entrenar.
    set-id: sha256(MANIFEST.tsv) = pendiente, el conjunto no existe todavía
  • Controles de contaminaciónAntes de cada entrenamiento: hashes, identidad de hablantes y coincidencias de 13 palabras contra la prueba.
Resultados por país: todas las celdas vacías porque nada se ha medido
PaísWERCERF1 puntuaciónComandosRúbrica actasAlucinaciones

Celdas vacías a propósito: ningún modelo se ha medido todavía. Cuando haya resultados, se publicarán con la versión del banco, la fecha, la lista de sistemas comparados y el método.

08 / Equipos propios08 / Our own equipment

Dimensionado para nuestras GPU.Sized for our own GPUs.

Entrenamos y servimos en equipos propios de CareCompile. Las cifras de memoria son objetivos y estimaciones aritméticas, no mediciones; la etapa 0 incluye una prueba corta para confirmarlas antes de cualquier trabajo largo.

We train and serve on CareCompile's own equipment. The memory figures are targets and arithmetic estimates, not measurements; stage 0 includes a short dry run to confirm them before any long job.

Entrenamiento

RTX 3090 · 24 GB

Ajuste con QLoRA de un modelo de ~8B y ajuste fino del oído. Estimación para una corrida típica: unos 12 a 15 GB de 24.

Pesos base, 4 bits
~5.0 GB
Adaptadores LoRA y optimizador
~1.0 GB
Activaciones, 8K tokens
~4-7 GB
Contexto CUDA
~1.5 GB
Servicio

RTX A2000 · 12 GB

Objetivo: cerebro a 5 bits con caché de 8 bits, junto al oído, en una sola tarjeta. Cabe, pero justo: unos 10 GB de 12.

Cerebro, pesos 5 bits
~5.7 GB
Caché KV 8 bits, 16K tokens
~1.3 GB
Contexto CUDA
~0.8 GB
Oído
~1.5-2.5 GB
Candidatos a evaluar

Modelos abiertos

Se eligen con la línea base, por país, en nuestro conjunto sellado. Ningún candidato tiene resultados nuestros todavía.

Oído: modelos abiertos de voz
  • Whisper large-v3-turbo OpenAI · MIT
  • Parakeet TDT 0.6B v3 NVIDIA · CC-BY-4.0
  • Granite Speech 4.1 2B IBM · Apache 2.0
Cerebro: modelos base de pesos abiertos
  • Granite 4.2 8B IBM · Apache 2.0
  • Gemma 4 E4B Google · Apache 2.0
  • Otros modelos abiertos de tamaño similar
09 / Marco ético09 / Ethical framework

Ocho principios que rigen el programa.Eight principles that govern the program.

Estos principios aplican a los datos, al entrenamiento y al uso de Vocero. Cada uno se desarrollará en un documento completo, que publicaremos aquí.

These principles apply to the data, the training and the use of Vocero. Each will be set out in a full document, which we will publish here.

01

Dignidad y consentimiento informado

Dignity and informed consent

Nadie aporta su voz sin saber para qué se usa. El consentimiento es escrito, claro y específico.

No one contributes their voice without knowing what it is for. Consent is written, clear and specific.

Documento completo: en preparación
02

Soberanía de los datos

Data sovereignty

Quienes aportan, y El Salvador, deciden sobre sus datos. No se revenden.

Contributors, and El Salvador, decide about their data. It is never resold.

Documento completo: en preparación
03

Propósito limitado

Limited purpose

Los datos sirven solo para construir y evaluar Vocero. Ningún otro uso.

The data is used only to build and evaluate Vocero. No other use.

Documento completo: en preparación
04

Transparencia

Transparency

Publicamos qué datos usamos, cómo medimos y cuáles son los límites del sistema.

We publish what data we use, how we measure, and the system's limits.

Documento completo: en preparación
05

No dañar: líneas rojas

Do no harm: red lines

Ni vigilancia masiva, ni perfilado político, ni identificar personas por la voz sin su consentimiento.

No mass surveillance, no political profiling, no identifying people by their voice without consent.

Documento completo: en preparación
06

Supervisión humana

Human oversight

Vocero asiste. Una persona revisa lo que se guarda o se envía, y decide.

Vocero assists. A person reviews what is saved or sent, and decides.

Documento completo: en preparación
07

Equidad lingüística

Linguistic equity

El español de El Salvador, con voseo, de todas las regiones, edades y géneros. No hay un único español «correcto».

The Spanish of El Salvador, with voseo, from every region, age and gender. There is no single "correct" Spanish.

Documento completo: en preparación
08

Rendición de cuentas

Accountability

Auditoría, derecho a retirarse y a borrar, revisión independiente y reporte de incidentes.

Audit, the right to withdraw and delete, independent review, and incident reporting.

Documento completo: en preparación
En preparación El documento completo del marco ético está en preparación y se publicará en esta sección. Mientras tanto, para cualquier pregunta: hola@vocero.icu. The full ethical framework document is being prepared and will be published in this section. Meanwhile, for any question: hola@vocero.icu.
10 / Estado10 / Status

Dónde estamos hoy.

  1. Hoy

  2. Después

  3. Todavía no
11 / Preguntas11 / Questions

Preguntas frecuentes.

12 / Contacto12 / Contact

¿Quiere verlo funcionar, o aportar datos?

  • Las demostraciones usan datos sintéticos, no reuniones reales.
  • Usamos lo que escribe solo para responderle.
  • Privacidad y solicitudes de derechos: hola@vocero.icuPrivacy and rights requests: hola@vocero.icu

Privacidad y solicitudes de derechos: hola@vocero.icu.Privacy and rights requests: hola@vocero.icu. Política de privacidad

Solicitar una demostración