La IA propia de CareCompileCareCompile's own AI/ v0, en desarrollo/ v0, in development
Dicte, reúnase y encuentre lo que se dijo.Dictate, meet, and find what was said.
Vocero convierte una reunión de gobierno en un acta con decisiones y responsables, que una persona revisa. Nuestro objetivo es que lo haga en el español de El Salvador, en equipos que controlamos.
Vocero turns a government meeting into minutes with decisions and owners, which a person reviews. Our goal is for it to do so in the Spanish of El Salvador, on equipment we control.
Pedimos una sola cosa: que El Salvador designe una contraparte institucional y abramos una conversación sobre voces y textos, bajo el marco ético.
We ask for one thing: that El Salvador designate an institutional counterpart and we open a conversation about voices and texts, under the ethics framework.
Etapa: en desarrollo, uso interno. El modelo propio aún no está entrenado. Las demostraciones son sintéticas.
PVista de presentación: muestra solo lo esencial. Pulse P otra vez para salir.Presentation view: shows only the essentials. Press P again to exit.
Ejemplo sintéticoEntonces cerramos el presupuesto en esta fase.
Animación ilustrativa. No usa su micrófono y no muestra resultados de un modelo.
01 / Demostración: reunión01 / Demo: meeting
De la conversación al acta.
Una reunión sintética, procesada paso a paso: el oído reconoce cada turno, el cerebro extrae entidades, acuerdos y tareas, y cada punto del acta cita su línea de origen. Pase el cursor sobre un punto del acta para ver de dónde sale.
Sintético: guion de ejemplo, no es rendimiento medido.
Audioseñal de la reunión
Oídoreconocimiento de voz
Textohablante, tiempo y palabras
Cerebromodelo de lenguaje: acuerdos, tareas, entidades
PersonaCarlosExtraído: persona, responsable de las sedesFechaesta semanaExtraído: fecha, plazo: esta semanaPersonaElenaExtraído: persona, responsable de la solicitudFechajuevesExtraído: fecha, plazo: jueves
5
Carlos00:22
Listo,yavisosiseatrasaelequipo.
Acta
El acta se arma cuando el cerebro termina de leer la transcripción.
Acuerdos
La fase uno queda cubierta con el presupuesto actual.L3
La fase dos se solicita antes del cierre trimestral.L3
Tareas
Confirmar las sedes
Responsable
Carlos
Fecha
esta semana
L4
Preparar la solicitud de la fase dos
Responsable
Elena
Fecha
jueves
L3,4
Pendiente
La cuarta sede depende de que llegue el equipo de cómputo.L2,5
{
"synthetic": true,
"meeting": "Llamada de planificación, ministerio",
"decisions": [
{
"text": "La fase uno queda cubierta con el presupuesto actual.",
"source_lines": [
3
]
},
{
"text": "La fase dos se solicita antes del cierre trimestral.",
"source_lines": [
3
]
}
],
"tasks": [
{
"task": "Confirmar las sedes",
"owner": "Carlos",
"due": "esta semana",
"source_lines": [
4
]
},
{
"task": "Preparar la solicitud de la fase dos",
"owner": "Elena",
"due": "jueves",
"source_lines": [
3,
4
]
}
],
"open_items": [
{
"text": "La cuarta sede depende de que llegue el equipo de cómputo.",
"source_lines": [
2,
5
]
}
],
"entities": [
{
"type": "place",
"text": "regiones del norte",
"value": "región: norte",
"line": 1
},
{
"type": "amount",
"text": "tres sedes",
"value": "3 sedes listas, 1 pendiente",
"line": 2
},
{
"type": "date",
"text": "cierre trimestral",
"value": "plazo: cierre del trimestre",
"line": 3
},
{
"type": "person",
"text": "Carlos",
"value": "responsable de las sedes",
"line": 4
},
{
"type": "date",
"text": "esta semana",
"value": "plazo: esta semana",
"line": 4
},
{
"type": "person",
"text": "Elena",
"value": "responsable de la solicitud",
"line": 4
},
{
"type": "date",
"text": "jueves",
"value": "plazo: jueves",
"line": 4
}
]
}
Escriba una pregunta o elija una sugerida. Cada respuesta cita las líneas de donde sale; si la reunión no lo dice, Vocero lo indica en lugar de inventar.
Qué extrajo0 / 7
Persona0
Aparecen a medida que se reconoce el audio.
Fecha0
Aparecen a medida que se reconoce el audio.
Cantidad0
Aparecen a medida que se reconoce el audio.
Lugar0
Aparecen a medida que se reconoce el audio.
Todo en esta demostración es un guion sintético que corre en su navegador: los tiempos, las ondas y las entidades ilustran el formato de salida, no el rendimiento de un modelo.
Dictado con las reglas realesDictation with the real rules
Pruébelo
Escriba lo que una persona diría en voz alta, con las órdenes habladas: «coma», «punto», «nueva línea», «no perdón». Verá cómo las reglas de dictado lo convierten en texto escrito.
Capa de reglas determinista. Todo ocurre en su navegador: sin micrófono, sin enviar nada.
estimados miembros del comité coma el presupuesto es de cuarenta mil punto nueva línea gracias punto
Texto escrito
Estimados miembros del comité, el presupuesto es de 40,000.
Gracias.
Órdenes aplicadas
coma se vuelve →,
cuarenta mil se vuelve →40,000
punto se vuelve →.
nueva línea se vuelve →línea nueva
punto se vuelve →.
Ambigüedades señaladas
Ninguna ambigüedad señalada en este texto.
Se dejaron como palabras
Ninguna orden se dejó como palabra.
Esto muestra solo las reglas de dictado; el reconocimiento de voz todavía no está entrenado.
02 / Datos para El Salvador02 / Data for El Salvador
Ayúdenos a que Vocero entienda cómo se habla en El Salvador.Help Vocero understand how El Salvador speaks.
Buscamos voces y textos de todo el país, aportados con consentimiento y bajo reglas claras. Lo que se aporte sirve solo para construir y evaluar Vocero.
We are looking for voices and texts from across the country, given with consent and under clear rules. What is contributed is used only to build and evaluate Vocero.
Buscamos voces de los 14 departamentos.We are looking for voices from all 14 departments.Hoy no hay datos de ningún departamento: se muestran los límites, no cobertura.There is no data from any department today: the map shows boundaries, not coverage.
Límite de un departamentoDepartment boundaryDepartamento elegidoSelected departmentGeometría: Natural Earth, dominio público.Geometry: Natural Earth, public domain.
Qué necesitamos
What we need
Audio leído con guion y habla espontánea, con su transcripción.
Voces de todas las regiones, edades y géneros.
Textos públicos con licencia clara.
Revisores nativos para calificar actas.
Scripted and spontaneous speech, with transcripts.
Voices from every region, age and gender.
Public texts with a clear license.
Native reviewers to score minutes.
Quién puede aportar
Who can contribute
Instituciones públicas, con textos de dominio público.
Universidades: estudiantes y docentes que quieran grabar.
Medios de comunicación, con archivos que puedan licenciar.
Personas voluntarias mayores de edad.
Public institutions, with public-domain texts.
Universities: students and staff who want to record.
Media outlets, with archives they can license.
Adult volunteers.
Cómo se gobierna
How it is governed
Consentimiento escrito e informado.
Propósito limitado: solo construir y evaluar Vocero.
Derecho a retirarse y a que se borren sus datos.
Los datos se guardan en equipos de CareCompile. Alojarlos dentro de El Salvador es una propuesta, aún no decidida.
Nada se revende.
Written, informed consent.
Limited purpose: only to build and evaluate Vocero.
The right to withdraw and have the data deleted.
Data is kept on CareCompile equipment. Hosting it inside El Salvador is a proposal, not yet decided.
Nothing is resold.
Qué no aceptamos
What we do not accept
Datos reales de pacientes.
Conversaciones privadas de cualquier persona sin su consentimiento.
Grabaciones de menores de edad.
Material sin derecho a compartirlo.
Real patient data.
Anyone's private conversations without their consent.
Recordings of minors.
Material you have no right to share.
¿Su institución, universidad o medio quiere participar?Would your institution, university or outlet like to take part?
Escríbanos por el formulario. Le explicamos el consentimiento y el proceso antes de que se grabe nada.Write to us through the form. We explain the consent and the process before anything is recorded.
03 / Por qué será difícil de copiar03 / Why this will be hard to copy
Lo que estamos construyendo, y lo que es verdad hoy.What we are building, and what is true today.
Hoy Vocero no tiene un foso. Tiene un plan para construirlo y herramientas que lo hacen creíble. Nada está entrenado y todavía no hay clientes.
Today Vocero has no moat. It has a plan to build one and tools that make the plan credible. Nothing is trained and there are no customers yet.
01En preparaciónIn preparation
Habla regional con consentimientoConsented regional speech
Por qué cuesta copiarloWhy it is hard to copy
Es habla de hablantes de la región, con consentimiento para cada uso y derecho a retirarlo. No se puede descargar ni comprar, solo se gana con confianza.It is speech from speakers across the region, with consent for each use and a right to withdraw it. It cannot be downloaded or bought, only earned through trust.
Qué existe hoyWhat exists today
Un borrador del consentimiento y un plan de 90 días. Ninguna hora recolectada.A consent draft and a 90-day plan. No hours collected.
Qué lo erosionaríaWhat would erode it
Un modelo abierto que añada la región, o un consentimiento defectuoso, que dejaría sin valor los datos.An open model that adds the region, or defective consent, which would make the data worthless.
02DiseñadoDesigned
Examen sellado por paísSealed exam per country
Por qué cuesta copiarloWhy it is hard to copy
Es un examen por país guardado por alguien que no entrena modelos, de modo que nadie pueda ajustar el modelo al examen.It is one exam per country, held by someone who does not train models, so nobody can tune a model to the exam.
Qué existe hoyWhat exists today
El diseño y el método, escritos. Todavía no hay un examen sellado.The design and the method, written down. There is no sealed exam yet.
Qué lo erosionaríaWhat would erode it
Que el examen se filtre, que parezca interesado si no lo custodia alguien ajeno, o que otro examen público sea mejor.The exam leaking, looking self-serving without an outside custodian, or a better public exam appearing.
03Buscamos contraparteSeeking a counterpart
Acuerdos de soberanía de datos con institucionesData-sovereignty agreements with institutions
Por qué cuesta copiarloWhy it is hard to copy
Cada acuerdo se construye con confianza, uno por uno, y estimamos que lleva de 6 a 18 meses. No se puede comprar.Each agreement is built on trust, one at a time, and we estimate 6 to 18 months. It cannot be bought.
Qué existe hoyWhat exists today
Ninguno firmado. Buscamos una primera contraparte en El Salvador.None signed. We are looking for a first counterpart in El Salvador.
Qué lo erosionaríaWhat would erode it
Un gran proveedor que ofrezca nube dentro del país, un cambio político o un solo incidente.A large vendor offering in-country cloud, a political change, or a single incident.
04Construido, probado con datos sintéticosBuilt, tested on synthetic data
Verificación y evaluación propiasOur own verification and evaluation
Por qué cuesta copiarloWhy it is hard to copy
Un verificador marca lo que el modelo inventa y una prueba mide con intervalos de confianza. Por sí solo el código se puede rehacer; lo difícil es calibrarlo con habla regional y usarlo en resultados públicos.A verifier flags what the model invents and a scorer measures with confidence intervals. On its own the code can be rebuilt; what is hard to copy is calibrating it on regional speech and using it in public results.
Qué existe hoyWhat exists today
Un verificador con 182 pruebas automáticas, el medidor y el registro. Probados solo con datos sintéticos.A verifier with 182 automated tests, the scorer and the ledger. Tested only on synthetic data.
Qué lo erosionaríaWhat would erode it
Que otro equipo reescriba el código. Por eso no lo presentamos como foso por sí solo.Another team rewriting the code. That is why we do not present it as a moat on its own.
05Construido, sintéticoBuilt, synthetic
Mundos sintéticos revisados por expertosSynthetic worlds checked by experts
Por qué cuesta copiarloWhy it is hard to copy
El generador se puede copiar. Lo difícil de copiar son los atlas regionales revisados por personas expertas y la red de revisores.The generator can be copied. What is hard to copy are the regional atlases checked by experts and the network of reviewers.
Qué existe hoyWhat exists today
Un generador de reuniones ficticias de la región, con actas correctas conocidas. La revisión de expertos no ha empezado.A generator of fictional regional meetings with known correct minutes. Expert review has not started.
Qué lo erosionaríaWhat would erode it
Que modelos de frontera produzcan datos parecidos a bajo costo. Además, los datos sintéticos enseñan nuestras plantillas, no el habla real.Frontier models producing similar data cheaply. Also, synthetic data teaches our templates, not real speech.
El ciclo que queremos poner en marchaThe loop we want to set turning
Línea discontinua: todavía no existe. Es el diseño de un ciclo, no uno que ya gire. Cada vuelta solo cuenta si cada paso se puede comprobar por fuera.Dashed line: does not exist yet. It is the design of a loop, not one that already turns. Each turn only counts if each step can be checked from outside.
Qué NO es nuestro fosoWhat is NOT our moat
Los modelos abiertosOpen modelsCualquiera puede descargarlos, y el siguiente será gratis para todos. Los usamos; no son nuestros.Anyone can download them, and the next one will be free for everyone. We use them; they are not ours.
Los librosBooksLeer un libro en voz alta no enseña cómo habla la región, y la lectura es una copia del libro.Reading a book aloud does not teach how the region speaks, and the reading is a copy of the book.
El texto de la webWeb textLos modelos base ya lo traen, y buena parte tiene derechos de autor. Lo que cualquiera puede bajar, otro también.Base models already contain it, and much of it is under copyright. Whatever anyone can download, someone else can too.
Un foso empieza el día en que la primera grabación con consentimiento entra al registro y alguien que no entrena modelos sella el primer examen.A moat starts the day the first consented recording enters the ledger and someone who does not train models seals the first exam.
04 / Marco ético04 / Ethical framework
Ocho principios que rigen el programa.Eight principles that govern the program.
Estos principios aplican a los datos, al entrenamiento y al uso de Vocero. Cada uno se desarrollará en un documento completo. El borrador se comparte a solicitud.
These principles apply to the data, the training and the use of Vocero. Each will be set out in a full document. The draft is shared on request.
01
Dignidad y consentimiento informado
Dignity and informed consent
Nadie aporta su voz sin saber para qué se usa. El consentimiento es escrito, claro y específico.
No one contributes their voice without knowing what it is for. Consent is written, clear and specific.
BorradorDraftEl marco ético completo está disponible como borrador para revisión legal. No es asesoría legal y todavía no lo ha revisado asesoría salvadoreña.The full ethical framework is available as a draft for legal review. It is not legal advice and has not yet been reviewed by Salvadoran counsel.Leer el marco éticoRead the ethical framework
En preparaciónEl documento completo del marco ético está en preparación. El borrador se comparte a solicitud, escribiendo a hola@vocero.icu. Todavía no publicamos su texto.The full ethical framework document is in preparation. The draft is shared on request, by writing to hola@vocero.icu. We have not published its text yet.
05 / Estado05 / Status
Dónde estamos hoy.
Vocero está en desarrollo y se usa solo dentro de CareCompile. El dictado funciona hoy con un motor que no es nuestro modelo propio. El modelo propio todavía no está entrenado; por eso no publicamos cifras de precisión, clientes ni precios: no los hay.
Estado por componente
Sitio y demostracionesOperativo, con datos sintéticos.Operativo hoy
Reconocimiento de voz y dictado en reuniones hoyOperativo con un motor que no es nuestro modelo.Operativo hoy
Capa de reglas de dictadoConstruida y probada sobre texto; el reconocimiento de voz no está entrenado.Construido
Grabadora de voces con consentimientoConstruida; cerrada hasta aprobar el consentimiento.Construido
Consola de controlConstruida.Construido
Marco éticoBorrador para revisión legal.En preparación
Banco de pruebas Vocero-BenchDiseñado.En preparación
Línea base de modelos abiertosAún no medida.Aún no
Datos regionalesNinguna hora recolectada.Aún no
Modelo propioNo entrenado.Aún no
Escalera de evidencia
1Hoy: en desarrollo y gobernado desde el inicioEstamos aquí
2Línea base medida
3Mejora medida en El Salvador
4Mejora en varios países sin retrocesos
5Mejor modelo abierto para el español de CentroaméricaSolo con un conjunto sellado de seis países.
6Despliegue en el país con una contraparte
No afirmamos un peldaño hasta tener su evidencia.
Sin cifras de precisión: aún no se han medido.
Sin lista de clientes: no la hay.
Sin precios ni fechas de lanzamiento.
El dictado de hoy usa un motor que no es nuestro modelo propio.
Última actualización: 6 de octubre de 2026, versión 3.2.0. Este tablero se actualiza a medida que cambia la evidencia.
06 / Contacto06 / Contact
Designe una contraparte y abramos la conversación.
Si su institución puede designar una contraparte, o prefiere ver primero la demostración con datos sintéticos, cuéntenos. Hablamos de voces y textos bajo el marco ético antes de que se grabe nada.
Para su equipo técnicoFor your technical teamAnexo técnicoTechnical annexArquitectura, dictado, entrenamiento, datos, evaluación, equipos y preguntas frecuentes. Es diseño y plan, no resultados medidos. Pulse para abrir.Architecture, dictation, training, data, evaluation, equipment and FAQ. It is design and plan, not measured results. Press to open.
Arquitectura
Cascada de dos modelosOído (voz a texto) y cerebro (lenguaje)
Idioma objetivo
Español de CentroaméricaMedido país por país, con voseo
Cerebro, objetivo
~8 mil millones de parámetrosCuantizado para caber en ~12 GB
Equipos propios
Equipos propios de CareCompile24 GB para entrenar, 12 GB para servir
Estado
Nada entrenado todavíaSin cifras de precisión: aún no se han medido
A1 / ArquitecturaA1 / Architecture
Un oído, un cerebro y reglas que se pueden auditar.An ear, a brain, and rules you can audit.
Vocero es una cascada, no un único modelo de audio de punta a punta. Cada pieza tiene su propia métrica y se puede medir, corregir o reemplazar por separado. Los comandos de dictado los aplica un motor de reglas, no un modelo de lenguaje. Las salidas pasan por una verificación contra la transcripción y, al final, por una persona.
Vocero is a cascade, not a single end-to-end audio model. Each part has its own metric and can be measured, fixed or replaced on its own. Dictation commands are applied by a rule engine, not by a language model. Outputs are checked against the transcript and, at the end, by a person.
Pase el cursor o use Tab sobre un cuadro: qué hace, cómo se mide y en qué estado está.Hover or Tab onto a box: what it does, how it is measured and its status.
Objetivo, no logradoTarget, not achieved
Basado en reglasRule-based
Se medirá despuésMeasured later
PersonaHuman
1Punto de medición contra el conjunto selladoMeasurement point against the sealed set
AudioAudioMicrófono para dictar, o el audio de una reunión.A microphone for dictation, or meeting audio.
Detección de vozVoice activity detectionSepara la voz del silencio antes de transcribir.Separates speech from silence before transcription.
Oído: voz a texto con puntuaciónEar: speech to text with punctuationModelo abierto de reconocimiento de voz, a ajustar con audio regional.An open speech recognition model, to be fine-tuned on regional audio.
Modo dictado: capa de comandosDictation mode: command layerReglas deterministas aplican coma, punto, nueva línea y correcciones. Resultado: texto dictado.Deterministic rules apply comma, period, new line and corrections. Result: dictated text.
Modo reunión: transcripciónMeeting mode: transcriptCon hablantes y marcas de tiempo, más un glosario regional y la lista de asistentes.With speakers and timestamps, plus a regional glossary and the attendee list.
Cerebro: modelo de lenguajeBrain: language modelObjetivo de unos 8 mil millones de parámetros, cuantizado para unos 12 GB. Escribe actas, tareas y respuestas con cita.Target of about 8 billion parameters, quantized for about 12 GB. Writes minutes, tasks and cited answers.
VerificaciónGrounding checkCada nombre, cifra, fecha y decisión debe aparecer en la transcripción; si no, se marca.Every name, number, date and decision must appear in the transcript; otherwise it is flagged.
Revisión humanaHuman reviewUna persona revisa antes de guardar o enviar.A person reviews before anything is saved or sent.
Conjunto de evaluación selladoSealed evaluation setMide cada pieza por separado. Lo custodia alguien que no entrena modelos.Measures each part on its own. Held by someone who does not train models.
Pieza 1Part 1Candidatos
Oído
Ear
Reconocimiento de voz con puntuación automática en reuniones. En dictado, escribe los comandos como etiquetas (<coma>, <nueva_linea>) en lugar de adivinar.
Speech recognition with automatic punctuation in meetings. In dictation, it writes commands as tags (<coma>, <nueva_linea>) instead of guessing.
Pieza 2Part 2Reglas
Capa de comandos
Command layer
Un motor de reglas probado: inserta puntuación, borra o corrige, y todo se puede deshacer. «Entró en coma» no es una coma: solo cuenta como comando en una pausa.
A tested rule engine: inserts punctuation, deletes or corrects, and every action can be undone. "Entró en coma" is not a comma: a word counts as a command only at a pause.
Pieza 3Part 3Candidatos
Cerebro
Brain
Lee la transcripción y devuelve datos estructurados: acta, tareas con responsable y fecha, y respuestas con la marca de tiempo de donde salen.
Reads the transcript and returns structured data: minutes, tasks with owner and due date, and answers with the timestamp they come from.
Pieza 4Part 4Siempre
Verificación y persona
Check and a person
Lo que no coincide con la transcripción se marca, no se presenta como hecho. Vocero asiste; una persona revisa y decide.
Anything that does not match the transcript is flagged, not shown as fact. Vocero assists; a person reviews and decides.
A2 / Demostración: dictadoA2 / Demo: dictation
Hable, y queda escrito.
En modo dictado, el oído escribe los comandos hablados como etiquetas y una capa de reglas los aplica. Mantenga pulsado el botón y observe cómo el texto bruto se convierte en texto final.
Sintético y simulado: no usa su micrófono.
Comandos de dictado
Se dice
Efecto
«coma»
escribe ,
«punto»
escribe . y sigue con mayúscula
«nueva línea»
salto de línea
«no perdón»
corrige la palabra anterior
Listo. Observe cómo se aplicó la coma, el punto, la línea nueva y la corrección.
Lo que el oído transcribeestimadosmiembrosdelcomitécomabuenastardespuntonuevalíneaelinformeestarálistoellunesnoperdónmartespunto
Texto final, tras la capa de comandos
Estimados miembros del comité, buenas tardes.
El informe estará listo el martes.
El ejemplo es un guion sintético; la capa de comandos que lo procesa es real y corre en su navegador. Una persona debe revisar el texto antes de guardarlo.
A3 / Cómo se entrenaA3 / How it is trained
Cinco etapas. Cada una con una puerta.Five stages. Each one has a gate.
No entrenamos desde cero: eso requiere miles de GPU. Partimos de modelos abiertos y los ajustamos con datos regionales. Ninguna etapa avanza si no pasa su puerta, y no hay fechas fijas: cada etapa espera a la anterior. Hoy ninguna etapa se ha ejecutado.
We do not train from scratch: that takes thousands of GPUs. We start from open models and adapt them with regional data. No stage moves on until it passes its gate, and there are no fixed dates: each stage waits for the one before. Today no stage has been run.
0
Línea base
Baseline
Correr los modelos base sin tocar, y el motor de dictado que funciona hoy, sobre el conjunto sellado. Error por país y puntaje de actas: la cifra que hay que superar.
Run the untouched base models, and the dictation engine running today, on the sealed set. Error per country and minutes scores: the number to beat.
PuertaGateLínea base escrita, con fecha y versiones exactas de cada modelo.Baseline written down, with the date and exact model versions.
Pendiente
1
Datos
Data
Reunir, revisar licencias, limpiar y separar por país. El conjunto de evaluación se aparta y se sella antes de cualquier entrenamiento.
Collect, check licenses, clean and split by country. The evaluation set is set aside and sealed before any training.
PuertaGateCada fuente con nota de licencia. Conjunto sellado con huella SHA-256.Every source has a license note. Set sealed with a SHA-256 fingerprint.
Pendiente
2
Oído
Ear
Ajuste fino de un modelo abierto de voz con audio regional, mezclado con español general para que no olvide lo que ya sabe.
Fine-tune an open speech model on regional audio, mixed with general Spanish so it does not forget what it already knows.
PuertaGateMejor que la línea base en el conjunto sellado, sin empeorar en ningún país, y al menos igual al dictado actual.Better than baseline on the sealed set, not worse in any country, and at least as good as today's dictation.
Pendiente
3
Cerebro
Brain
Ajuste por instrucciones (QLoRA) para actas, tareas y respuestas con cita; después, ajuste por preferencias contra invenciones. Preentrenamiento continuo solo si hace falta.
Instruction tuning (QLoRA) for minutes, tasks and cited answers; then preference tuning against invented content. Continued pretraining only if needed.
PuertaGateLos revisores lo califican mejor que el modelo base, sin nombres, cifras ni decisiones inventados.Reviewers rate it above the base model, with no invented names, numbers or decisions.
Pendiente
4
Paquete
Package
Fusionar los adaptadores, cuantizar y servir en equipos propios, detrás de un interruptor apagado por defecto.
Merge the adapters, quantize, and serve on our own equipment, behind a switch that is off by default.
PuertaGateAprobación explícita del responsable del programa para encender el interruptor.Explicit approval from the program lead to turn the switch on.
Pendiente
A4 / Preentrenamiento y datosA4 / Pretraining and data
El cuello de botella son los datos regionales.The bottleneck is regional data.
Los conjuntos abiertos de voz en español vienen sobre todo de España, México y Sudamérica. Hay muy poco audio abierto de Centroamérica, y sin él el oído no mejora donde importa. Por eso la mayor parte del trabajo real es reunir datos regionales con consentimiento.
Open Spanish speech sets come mostly from Spain, Mexico and South America. There is very little open Central American audio, and without it the ear will not improve where it matters. That is why most of the real work is collecting consented regional data.
Preentrenamiento continuoContinued pretrainingCPT
Seguir entrenando un modelo ya preentrenado con mucho texto sin etiquetar de la región: documentos públicos, noticias, enciclopedias con licencia. El modelo aprende vocabulario, nombres y giros. No le enseña una tarea. Lo haremos solo si la línea base muestra un vacío de vocabulario que el glosario no resuelve.
Keep training an already pretrained model on a large amount of unlabeled regional text: public documents, news, licensed encyclopedias. The model learns vocabulary, names and turns of phrase. It does not learn a task. We will do it only if the baseline shows a vocabulary gap that the glossary does not fix.
Ajuste finoFine-tuningLoRA / QLoRA
Entrenar con ejemplos etiquetados de la tarea: audio con su transcripción para el oído; transcripción con su acta revisada para el cerebro. Con LoRA solo se entrenan unas matrices pequeñas añadidas al modelo; por eso cabe en una GPU de 24 GB. Un ajuste completo de 8B necesitaría unos 128 GB.
Train on labeled examples of the task: audio with its transcript for the ear; a transcript with its reviewed minutes for the brain. With LoRA only small added matrices are trained, which is why it fits on a 24 GB GPU. A full fine-tune of an 8B model would need about 128 GB.
Qué hace distinto al español de El SalvadorWhat makes Salvadoran Spanish different
Voseo: «vos tenés», «decime». Un modelo entrenado con otro español puede «corregirlo» sin pedirlo.Voseo: "vos tenés", "decime". A model trained on other Spanish may "correct" it unasked.
Aspiración de la /s/ final: la /s/ al final de sílaba suena como [h], lo que confunde al reconocimiento de voz general.Final /s/ aspiration: syllable-final /s/ sounds like [h], which confuses general speech recognition.
Vocabulario local: «pisto», «cipote», «chunche», y nombres de lugares, instituciones y apellidos de la región.Local vocabulary: "pisto", "cipote", "chunche", and regional place names, institutions and family names.
Reuniones reales: cambios entre español e inglés, varios hablantes, audio de teléfono.Real meetings: switching between Spanish and English, several speakers, phone-quality audio.
Necesidades de datos para El SalvadorData needs for El SalvadorEstimación de planificación
Dato
Para qué
Cantidad
Origen posible
Regla
Audio de entrenamiento con transcripción
Ajustar el oído al habla salvadoreña
~20 hestimación de planificación
Hablantes que consienten: lectura con guion y habla espontánea; todas las regiones, edades y géneros
Consentimiento escrito que dice que el audio entrena un modelo
Audio de prueba sellado
Medir sin trampas
~3 hestimación de planificación
Hablantes distintos de los de entrenamiento
Nunca se usa para entrenar; lo guarda un custodio
Clips de dictado
Comandos, números, fechas y nombres de la región
por definirsegún el guion
Guiones que escribimos, leídos por hablantes que consienten
Mismo consentimiento que el audio de entrenamiento
Texto regional
Vocabulario y nombres para el cerebro
por definirsolo si la línea base lo pide
Documentos públicos y archivos de noticias cuya licencia lo permita
Nota de licencia por fuente; no se extrae de sitios que lo prohíben
Ejemplos estilo reunión
Enseñar a escribir actas, tareas y respuestas
milespara todo el programa
Reuniones sintéticas que escribimos; reales solo con consentimiento
Marcadas como sintéticas; una persona aprueba cada ejemplo
Español general
Que el oído no olvide lo que ya sabe
existenteconjuntos abiertos
Conjuntos abiertos de voz en español
Licencia revisada y registrada antes de usarlos
Las horas son estimaciones de planificación, no compromisos ni datos ya reunidos. Hoy no se ha grabado ningún audio para este programa.
A5 / EvaluaciónA5 / Evaluation
Vocero-Bench CentroaméricaCentral America.
Un banco de pruebas diseñado para medir dictado, transcripción, actas y respuestas por país, calificado a ciegas y con intervalos de confianza. Está en diseño: no se ha grabado audio, no se ha sellado el conjunto y no se ha calificado ningún modelo.
A benchmark designed to measure dictation, transcription, minutes and answers per country, scored blind and with confidence intervals. It is in design: no audio has been recorded, no set has been sealed and no model has been scored.
Error de palabras
WER = (S + D + I) / N
Sustituciones, borrados e inserciones sobre palabras de referencia, a nivel de corpus. Se publica con y sin tildes.
Error de caracteres
CER
La misma fórmula sobre caracteres. Útil con nombres propios y palabras locales.
Puntuación
F1 = 2PR / (P + R)
Comas, puntos, saltos de línea, y los signos de apertura ¿ y ¡ como clases propias.
Comandos
LCS(ref, hip) / Nref
Precisión de comandos en orden, activaciones falsas y comandos escritos en vez de ejecutados.
Rúbrica de revisores
1 a 5 · κ ≥ 0.70
Dos revisores nativos por país, a ciegas: completitud, exactitud, utilidad y registro. Los desacuerdos se publican.
Alucinaciones
k de n, cota 95%
Cualquier nombre, cifra o decisión que no esté en la transcripción. Nunca decimos «cero».
Conjunto sellado80% de prueba sellada y 20% de desarrollo público, separados por hablante y por reunión.
Custodio independienteUna persona que no entrena modelos guarda el audio de prueba. Quien entrena nunca lo ve; solo recibe resultados agregados por país.
Huella públicaCada archivo tiene su SHA-256; la huella del manifiesto identifica el conjunto y se publica antes de entrenar.
set-id: sha256(MANIFEST.tsv) = pendiente, el conjunto no existe todavía
Controles de contaminaciónAntes de cada entrenamiento: hashes, identidad de hablantes y coincidencias de 13 palabras contra la prueba.
Resultados por país: todas las celdas vacías porque nada se ha medido
País
WER
CER
F1 puntuación
Comandos
Rúbrica actas
Alucinaciones
SVEl Salvador
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
GTGuatemala
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
HNHonduras
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
NINicaragua
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
CRCosta Rica
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
PAPanamá
sin medir
sin medir
sin medir
sin medir
sin medir
sin medir
Celdas vacías a propósito: ningún modelo se ha medido todavía. Cuando haya resultados, se publicarán con la versión del banco, la fecha, la lista de sistemas comparados y el método.
A6 / Equipos propiosA6 / Our own equipment
Dimensionado para nuestras GPU.Sized for our own GPUs.
Entrenamos y servimos en equipos propios de CareCompile. Las cifras de memoria son objetivos y estimaciones aritméticas, no mediciones; la etapa 0 incluye una prueba corta para confirmarlas antes de cualquier trabajo largo.
We train and serve on CareCompile's own equipment. The memory figures are targets and arithmetic estimates, not measurements; stage 0 includes a short dry run to confirm them before any long job.
Entrenamiento
Equipo de entrenamiento · 24 GB
Ajuste con QLoRA de un modelo de ~8B y ajuste fino del oído. Estimación para una corrida típica: unos 12 a 15 GB de 24.
4-bit
012 GB24 GB
Pesos base, 4 bits
~5.0 GB
Adaptadores LoRA y optimizador
~1.0 GB
Activaciones, 8K tokens
~4-7 GB
Contexto CUDA
~1.5 GB
Servicio
Equipo de servicio · 12 GB
Objetivo: cerebro a 5 bits con caché de 8 bits, junto al oído, en una sola tarjeta. Cabe, pero justo: unos 10 GB de 12.
5-bit
06 GB12 GB
Cerebro, pesos 5 bits
~5.7 GB
Caché KV 8 bits, 16K tokens
~1.3 GB
Contexto CUDA
~0.8 GB
Oído
~1.5-2.5 GB
Candidatos a evaluar
Modelos abiertos
Se eligen con la línea base, por país, en nuestro conjunto sellado. Ningún candidato tiene resultados nuestros todavía.
Oído: modelos abiertos de voz
Whisper large-v3-turbo OpenAI · MIT
Parakeet TDT 0.6B v3 NVIDIA · CC-BY-4.0
Granite Speech 4.1 2B IBM · Apache 2.0
Cerebro: modelos base de pesos abiertos
Granite 4.2 8B IBM · Apache 2.0
Gemma 4 E4B Google · Apache 2.0
Otros modelos abiertos de tamaño similar
A7 / PreguntasA7 / Questions
Preguntas frecuentes.
¿Qué es Vocero?
Vocero es la IA propia de CareCompile. Dicta, escucha reuniones, las resume en actas y tareas, y responde preguntas sobre lo que se dijo, con la línea de donde sale cada respuesta.
¿Ya está entrenado el modelo propio?
No. Hay un plan de entrenamiento por etapas y un diseño de evaluación, pero ninguna etapa se ha ejecutado. El dictado que funciona hoy usa otro motor. No publicamos cifras de precisión porque no las hay.
¿Qué modelos usarán?
Modelos abiertos que todavía son candidatos a evaluar: modelos abiertos de voz para el oído y modelos base de pesos abiertos de unos 8 mil millones de parámetros para el cerebro. Se elegirán según los resultados de la línea base en nuestro conjunto sellado, país por país.
¿Por qué no usar un modelo general en la nube?
Los modelos generales se entrenan sobre todo con otro español y no se miden país por país en Centroamérica. Además, queremos que el audio quede en equipos propios. Un modelo general seguirá razonando mejor en muchas tareas; nuestro objetivo es estrecho y medible: el español de la región, el dictado y las actas.
¿Dónde corre?
En equipos propios de CareCompile: un equipo de entrenamiento con 24 GB de memoria de GPU y uno de servicio con 12 GB, según el plan.
¿Qué pasa con los datos que se aporten?
Se usan solo para construir y evaluar Vocero, con consentimiento escrito, en equipos de CareCompile y sin reventa. Quien aporta puede retirarse y pedir que se borren sus datos escribiendo a hola@vocero.icu. No aceptamos datos reales de pacientes ni conversaciones privadas sin consentimiento.
¿Para qué países?
Vocero apunta al español de Centroamérica, y el banco de pruebas está diseñado para medir cada país por separado. La cobertura se confirmará con mediciones; todavía no prometemos ningún país en particular.
¿Qué datos guarda este sitio?
Este sitio no usa cookies ni analítica. Lo único que guarda su navegador es el idioma que usted elija. Si envía el formulario, guardamos lo que escribe para poder responderle. El dictado de ejemplo no usa su micrófono. El detalle está en la política de privacidad; para privacidad y solicitudes de derechos: hola@vocero.icu.
¿Cómo pido una demostración?
Complete el formulario al final de esta página. La demostración usa datos sintéticos, no reuniones reales.
¿Qué es el modo presentación?
Pulse la tecla P (o el botón P de la barra superior) para ver una versión simplificada: solo la portada, la demostración de reunión, los datos para El Salvador, por qué será difícil de copiar, el estado y el contacto, con letra más grande. Pensado para proyectar en una sala. Pulse P otra vez para salir.