Inicio // NÚCLEOS PERICIALES // DOCUMENTO, VOZ E IMAGEN

Fonética Forense y Peritaje de Voz

La voz no es una huella dactilar, y es exactamente por eso que el método importa: especialización en Identificación Forense de Hablantes (CEFAC), examen híbrido perceptivo-acústico y conclusiones probabilísticas construidas para resistir al contradictorio.

Lo que responde la pericia de voz

Nueve exámenes, un vocabulario preciso

El mercado confunde identificación, comparación, verificación y perfil de hablante. La elección del examen correcto decide el valor de la prueba; cada uno responde una pregunta diferente.

01

Comparación de locutor

La tarea central: el examen compara la muestra cuestionada con la muestra de cotejo del comparado y concluye en grado de sustento probabilístico, en la escala de 9 puntos (de -4 a +4, con el cero inconcluyente), evaluando similitud y tipicidad: cuán parecidas son las características y cuán comunes en la población.

02

Identificación de locutor

Término paraguas: situar a un hablante desconocido dentro o fuera de un conjunto de candidatos. En escenario cerrado, el autor está entre ellos; en escenario abierto, puede no estar, y el dictamen declara esa diferencia antes de concluir.

03

Comparación de interlocutores

Quién es quién dentro del mismo diálogo: intervenciones telefónicas, audios de grupo y reuniones grabadas con múltiples voces tienen cada intervención atribuida al respectivo interlocutor.

04

Verificación de locutor (biometría de voz)

Autenticación uno a uno contra modelo registrado: lógica de acceso, no de prueba. La biometría comercial no se confunde con la pericia, y el dictamen explica por qué.

05

Perfil de hablante

Cuando no hay sospechoso, el habla describe al hablante: sexo, franja etaria, origen regional, escolaridad y eventuales patologías, con base en sociofonética.

06

Transcripción y transcripción forense

Desgrabación fiel y normalizada: pausas, vacilaciones, superposiciones y pasajes ininteligibles marcados, con hipótesis fonéticas documentadas y grado de confiabilidad declarado por pasaje. Nada que ver con la transcripción comercial o automática.

07

Autenticidad e integridad de audio

Cortes, inserciones y montajes dejan vestigios: discontinuidad espectral, salto de ruido de fondo, recompresión, firma de códec. La vía es doble: probar la edición o documentar la ausencia de vestigios, sustentando la integridad.

08

Voz sintética y clonada (deepfake de audio)

Examen con metodología declarada: artefactos de vocoder, prosodia anómala, ausencia de las microvariaciones fisiológicas de la voz humana (jitter y shimmer naturales) y vestigios digitales del propio archivo.

09

Exámenes complementarios

Realce de inteligibilidad (enhancement) que nunca crea contenido; análisis de fuentes sonoras no vocales (disparos, impactos, secuencia de eventos) y reconstrucción de audibilidad de la escena; toma de muestra de voz por protocolo dirigido; contraprueba de dictamen ajeno, formulación de puntos de pericia y asistencia técnica.

Del oído entrenado al espectrograma: el examen de la voz
Cómo se hace el examen

Método híbrido perceptivo-acústico, el estándar internacional

El examen combina el oído entrenado y el instrumento, conforme a la práctica recomendada por la IAFPA y por el Best Practice Manual de la ENFSI, conducido con especialización en Identificación Forense de Hablantes (CEFAC).

Análisis perceptivo-auditivo
  • Calidad vocal, con protocolo VPA de Laver
  • Acento e idiolecto: las marcas personales del habla
  • Tasa de elocución y de articulación
  • Disfluencias y vacilaciones características
  • Patrones prosódicos y elecciones léxicas
Análisis acústico-instrumental
  • Espectrogramas y medidas espectrales
  • Formantes F1 a F4, en distribuciones de largo plazo
  • Frecuencia fundamental (f0): media, variabilidad y largo plazo
  • Jitter, shimmer y VOT
  • Medidas de prosodia y ritmo

Cuando el material lo permite, el análisis perceptivo-acústico se complementa con sistemas automáticos de comparación de locutor, siempre bajo supervisión e interpretación humana: la máquina calcula, el perito concluye. Y todo examen pasa por control de calidad: doble verificación de los hallazgos, documentación que permite la reproducción por otro perito y atención declarada a la mitigación del sesgo de contexto.

La conclusión sale en razón de verosimilitud: el dictamen no declara "es la persona"; cuantifica cuánto sustenta la evidencia la hipótesis de mismo hablante frente a la hipótesis de hablantes diferentes, en escala verbal de 9 puntos. Es la forma de concluir que resiste al contradictorio.

El flujo en fases
TriajeEvaluación de viabilidad del material, sin costo, con respuesta en hasta 48 horas hábiles
AutenticidadVerificación de integridad y calidad de la grabación antes de cualquier comparación
MuestraToma dirigida de muestra de voz, presencial o por videoconferencia
AnálisisExamen perceptivo-auditivo y acústico-instrumental de las muestras
DictamenConclusión en razón de verosimilitud, en la escala de 9 puntos, con método documentado
SustentaciónDefensa técnica del dictamen en juicio, aclaraciones y respuesta a los puntos de pericia
Diferencial

El audio nace preservado: fonética y forense computacional en la misma firma

Antes del examen de voz, la extracción forense del audio original directo del aparato (iOS y Android), antes de la recompresión de la aplicación, con hash, vinculación al dispositivo y cadena de custodia documentada. El examen comienza en la fuente de la prueba, no en la copia que sobrevivió al reenvío.

Respaldo metodológico: IAFPA · ENFSI Best Practice Manual for Forensic Speaker Comparison.

Límites declarados

Lo que la fonética forense no afirma

La limitación declarada es fuerza, no debilidad: es lo que diferencia la ciencia de la mera opinión, y es donde caen los dictámenes frágiles.

Un dictamen de voz categórico es un dictamen frágil

La superposición ingenua de espectrogramas y las certezas absolutas no resisten al contradictorio. La contraprueba técnica examina el método del dictamen adversario y señala, punto por punto, dónde no se sostiene.

Estación de análisis de audio forense: espectrogramas en análisis y captación en ambiente tratado
AUDIO Y VOZ · Estación de análisisAmbiente tratado
Material necesario

Lo que el examen necesita para comenzar

DuraciónPor debajo de unos 10 segundos de habla neta hay poca información de hablante; lo deseable queda entre 20 y 60 segundos por muestra. El triaje declara con franqueza lo que el material permite
CalidadRelación señal-ruido razonable y mínimo de superposición de voces; el ruido extremo puede inviabilizar el examen
CanalTeléfono comparado con teléfono siempre que sea posible: el canal desplaza formantes. El origen de la grabación (aplicación, intervención telefónica, grabadora, CCTV) debe ser informado
OriginalEl reenvío por WhatsApp recomprime y borra metadatos. Envío solo por nube (Drive, WeTransfer o enlace seguro), nunca por el cuerpo de la conversación; si es inevitable, "enviar como documento". Mejor aún: extracción del bruto directo del aparato, con cadena de custodia
Muestra de vozToma dirigida, con habla espontánea y lectura, replicando cuando sea posible las condiciones de la muestra cuestionada
LicitudLa grabación ambiental hecha por uno de los interlocutores es lícita como prueba, según el STF (Supremo Tribunal Federal brasileño), Tema 237 de repercusión general, RE 583937; las intervenciones telefónicas exigen los requisitos de la Ley 9.296/1996 brasileña
Para quién

Dónde la pericia de voz decide casos

Penal

Intervenciones telefónicas, grabaciones y exclusión de sospechoso

Integridad de intervenciones telefónicas y atribución de voces (quién es quién), grabaciones clandestinas, amenazas por audio y exclusión de sospechoso: la prueba negativa también es resultado, y ya libró a inocentes de una acusación.

Laboral

Audios en conflictos de trabajo

Acoso y ofensa en grupos de mensajería, autenticidad de grabación de reunión, negativa de autoría de audio atribuido a un empleado o a un empleador.

Familia

Disputas de custodia y conflictos familiares

Audios en disputas de custodia y alegaciones de alienación parental, amenazas entre excónyuges, verificación de montaje en grabaciones domésticas.

Empresarial

Compliance y fraude por voz

Fraude del falso ejecutivo por voz clonada, autenticidad de grabaciones de reunión, investigaciones internas y validación de evidencias del canal de denuncias.

Dudas frecuentes de este núcleo
¿Es posible identificar a alguien solo por la voz?
No como una "huella dactilar". El examen expresa grados de sustento probabilístico a las hipótesis en disputa, en la escala de 9 puntos, y es así como la prueba resiste al contradictorio.
¿Cuánto audio es necesario?
Regla práctica: menos de unos 10 segundos de habla neta rara vez viabiliza el examen; lo deseable queda entre 20 y 60 segundos por muestra. El triaje, sin costo, responde para su caso específico.
¿Sirve un audio de WhatsApp?
Sirve, con reserva: el reenvío comprime el archivo y borra metadatos. El diferencial del laboratorio es la extracción del audio bruto directo del aparato, con cadena de custodia: fonética y forense computacional en la misma firma.
¿Se puede probar que el audio fue editado? ¿Y que NO lo fue?
Ambos exámenes existen. La edición deja vestigios espectrales y de compresión; la ausencia documentada de esos vestigios, por método declarado, sustenta la integridad de la grabación.
¿Y si la voz está disfrazada, o es de un gemelo?
Límites reales, declarados en el dictamen: el disfraz, el canal degradado y el parentesco próximo dificultan el examen y pueden llevar a un resultado inconcluyente. Un dictamen serio lo dice con todas las letras.
¿Se puede detectar una voz clonada por IA?
Sí: el examen busca artefactos de síntesis, prosodia anómala y la ausencia de las microvariaciones fisiológicas de la voz humana, sumados a los vestigios digitales del propio archivo.
¿Un resultado inconcluyente significa que la pericia fue inútil?
No: lo inconcluyente delimita lo que la evidencia sustenta y, con frecuencia, derriba un dictamen adversario demasiado categórico. Conocer el límite de la prueba también es ventaja procesal.
¿Vale un dictamen de parte en juicio? ¿Quién puede hacerlo?
Vale como informe técnico y asistencia técnica, en los términos del CPC (Código Procesal Civil brasileño). El examen exige formación específica: en VALLIM, especialización en Identificación Forense de Hablantes (CEFAC) sumada a 25 años de forense computacional.
Casos realizados
CASO ANONIMIZADO

Identificación de hablante en grabación clandestina en disputa familiar

El análisis fonético comparativo concluyó por la no identificación, excluyendo a la persona como autora del habla cuestionada.

Prueba multimedia completa

La voz es una parte. El resto de la prueba también tiene examen.

Envíe su audio para evaluación de viabilidad

El triaje inicial es sin costo y dice con franqueza lo que el material permite: duración, calidad, canal y posibilidades reales de conclusión. Respuesta en hasta 48 horas hábiles.

Solicitar evaluación sin costo
Casos representativos

El nivel de trabajo que usted contrata

Antes de decidir, vale ver lo que ya pasó por este laboratorio: casos descritos sin identificar a las partes, en el formato desafío, método y resultado.

Ver todos los casos representativos →

La prueba técnica que su caso necesita. La autoridad que el juzgado respeta.

Consulta inicial de viabilidad sin costo. Respuesta en hasta 24h en días hábiles.
Solicitar Peritaje