# Evaluación de aplicaciones con modelos de lenguaje

**Categoría:** Inteligencia artificial · **Nivel:** Intermedio · **Lectura:** 14 min
**Publicada:** 2026-07-27 · **Actualizada:** 2026-07-27 · **Autoría:** Underc0de
**Versión HTML (canónica):** https://underc0de.org/guias/inteligencia-artificial/evaluacion-de-aplicaciones-con-modelos-de-lenguaje/

## Respuesta rápida

Evaluar una aplicación con modelos de lenguaje es construir un **sistema de medición propio**, porque los benchmarks públicos comparan modelos en tareas generales y no responden si *tu* sistema resuelve *tu* tarea. La documentación de Anthropic resume el diseño en tres principios: ser **específico de la tarea**, **automatizar cuando se pueda** y **priorizar el volumen sobre la calidad** de cada caso. Los métodos de calificación van de lo más barato a lo más flexible: **coincidencia exacta**, **similitud semántica**, **solapamiento de texto** y **modelo juez**. Y el paso que suele faltar: si usás un modelo como juez, hay que **validar su concordancia con personas**.

## De qué se trata esta guía

| Pregunta | Dónde se responde |
|---|---|
| ¿Cómo se prueba algo que no tiene una única respuesta correcta? ¿Qué es el problema del oráculo? ¿Cómo se arma un conjunto de casos desde cero y cómo se prueba el sesgo? | [Testing de aplicaciones con inteligencia artificial](../../testing/testing-de-aplicaciones-con-inteligencia-artificial/index.md) |
| **¿Con qué método califico cada caso? ¿Puedo confiar en un modelo que hace de juez? ¿Qué mido en un RAG o en un agente? ¿Qué sigo midiendo en producción?** | **Esta guía** |

## Por qué los benchmarks no alcanzan

**HELM** —*Holistic Evaluation of Language Models*— se describe como «un marco de Python de código abierto creado por el Centro de Investigación en Modelos Fundacionales de Stanford para la evaluación holística, reproducible y transparente de modelos fundacionales». Mide **más allá de la exactitud**: incorpora eficiencia, sesgo y toxicidad.

Pero no responde tu pregunta. Tres razones:

- **Tu tarea no está en el benchmark.** Clasificar reclamos con tu taxonomía interna no se parece a responder preguntas de examen.
- **Contaminación.** Los conjuntos públicos pueden haber entrado en los datos de entrenamiento: un puntaje alto puede ser memoria y no capacidad.
- **Distribución distinta.** Tus entradas reales tienen faltas de ortografía, jerga interna y pedidos ambiguos.

Usalos para **preseleccionar**. Un detalle de actualidad: el propio HELM entró en **modo mantenimiento** en junio de 2026, lo que dice bastante sobre la velocidad a la que envejecen las referencias de evaluación.

## Los tres principios de diseño

1. **Ser específico de la tarea.** «Diseñá evaluaciones que reflejen la distribución de tu tarea del mundo real. ¡No te olvides de incluir los casos límite!» Entre ellos: datos irrelevantes, entradas demasiado largas, entradas pobres o dañinas, y casos ambiguos donde ni las personas llegan a un consenso.
2. **Automatizar cuando se pueda.** «Estructurá las preguntas para permitir calificación automática»: opción múltiple, coincidencia de cadenas, calificación por código o por otro modelo.
3. **Priorizar el volumen sobre la calidad.** «Más preguntas con calificación automática de señal algo menor es mejor que menos preguntas con evaluaciones hechas a mano de alta calidad.»

El tercero es el que más importa. Con **diez casos**, que uno cambie de resultado mueve el puntaje diez puntos y no hay manera de distinguir una mejora real del ruido.

## Los cuatro métodos de calificación

| Método | Cuándo usarlo | Su límite |
|---|---|---|
| **Coincidencia exacta** | Respuestas categóricas y sin ambigüedad | Falla ante cualquier variación de forma |
| **Similitud semántica** | Consistencia: preguntas parecidas deberían dar respuestas parecidas | Dice si se parecen, no si son correctas |
| **Solapamiento de texto** | Relevancia y coherencia en generación, sobre todo resumen | Un buen resumen con otras palabras puntúa bajo |
| **Modelo juez** | Criterios subjetivos: tono, si se apoya en las fuentes, si respeta una política | Cuesta más, tarda más y **hay que validarlo** |

Del cuarto método hay tres formas de pedir el veredicto: **escala tipo Likert** de 1 a 5, **clasificación binaria** para criterios de cumplir o no cumplir, y **escala ordinal** para grados. Para lo que se puede expresar como **sí o no**, usar binario: las escalas de 1 a 5 dan una ilusión de precisión y agregan variabilidad.

## Validar al juez

> «Generalmente es mejor práctica usar **un modelo distinto** para evaluar que el modelo usado para generar la salida evaluada.»

1. **Dos personas califican una muestra.** Cien casos, la misma rúbrica, sin verse entre ellas.
2. **Medir la concordancia entre las personas.** Si no coinciden, el problema es la **rúbrica**: es ambigua.
3. **Medir la concordancia del juez con las personas.** Si ellas coinciden y el juez se aparta, hay que corregir su prompt o su rúbrica.

El paso dos produce el hallazgo más útil: buena parte de las veces, el desacuerdo entre personas revela que **nadie tenía claro qué se estaba midiendo**.

> **Dos sesgos conocidos:** el **orden** en que se presentan dos respuestas a comparar, y la **extensión**, porque las respuestas más largas suelen puntuar mejor aunque no sean más correctas. Se comprueban alternando el orden y revisando si el puntaje correlaciona con la cantidad de palabras.

## Qué medir según la tarea

| Tarea | Qué medir | Con qué método |
|---|---|---|
| Clasificación o extracción | Exactitud **por clase**, no global; y la matriz de confusión | Coincidencia exacta |
| Resumen | Fidelidad al original y **ausencia de datos agregados** | Solapamiento más juez binario |
| [Sistema RAG](../como-crear-un-sistema-rag-con-documentos-propios/index.md) | **Recuperación** y **fundamentación**, por separado | Recuperación por código; fundamentación con juez binario |
| [Agente](../agentes-de-ia-y-model-context-protocol/index.md) | Tareas completadas, pasos usados y **acciones no autorizadas intentadas** | Verificación del estado final por código |

La **exactitud global engaña** con clases desbalanceadas: un clasificador que nunca detecta la clase rara puede tener 97 % de exactitud y ser inútil. Y en agentes, la métrica que suele faltar mide [seguridad](../seguridad-de-agentes-y-aplicaciones-de-ia/index.md), no calidad.

## Del puntaje al portón

```yaml
# El portón es el umbral, no la opinión del modelo
evaluacion:
  conjunto: casos/v3/               # fijo y versionado con el código
  umbrales:
    clasificacion_por_clase: ">= 0.90"   # por clase, no global
    fundamentacion: ">= 0.95"            # juez binario ya validado
    acciones_no_autorizadas: "== 0"      # sin tolerancia
  bloquea: true                      # comparar número contra umbral: determinista

# Lo que NO bloquea: pedirle a un modelo que opine si el cambio está bien.
```

**Comparar un puntaje contra un umbral es determinista** y por eso puede bloquear. Dejar que un modelo decida con criterio libre introduce un control que cambia de opinión sin que cambie el código. Cómo conectarlo a un pipeline está en [IA aplicada a pipelines CI/CD](../../devops-cloud/inteligencia-artificial-en-pipelines-ci-cd/index.md).

## Medir en producción

- **Trazas con muestreo.** Entrada, contexto recuperado, salida y modelo usado. Sin traza no hay diagnóstico, y sin diagnóstico no hay caso nuevo para el conjunto.
- **Un circuito de anotación.** Revisar una muestra por semana y clasificar las fallas. Cada falla clasificada es un caso que se suma.
- **Costo y latencia como métricas de calidad.** Una respuesta perfecta que tarda cuarenta segundos falló en un sentido que importa.

**Guardar entradas y salidas es guardar datos de las personas.** Hay que decidir qué se registra, por cuánto tiempo y quién puede verlo.

## Errores frecuentes

- **Probar veinte casos a mano y declarar que funciona.**
- **Confiar en un puntaje de juez sin validarlo.**
- **Usar el mismo modelo para generar y para juzgar.**
- **Mirar la exactitud global.**
- **Usar escalas de 1 a 5 para todo.**
- **No versionar el conjunto de casos.**
- **Medir solo antes de salir.**
- **Ignorar costo y latencia.**

## Preguntas frecuentes

**¿Por qué no me sirve el puntaje de un benchmark público?**
Porque mide otra cosa: compara modelos en tareas generales. Hay además contaminación de los conjuntos públicos y diferencia de distribución con tus entradas reales.

**¿Cuántos casos necesita una evaluación para servir?**
Más de los que la intuición sugiere: «priorizá el volumen sobre la calidad». Con diez casos no se distingue una mejora del ruido.

**¿Qué es un modelo juez y cuándo conviene?**
Usar un modelo para calificar la salida de otro según una rúbrica. Conviene con criterios subjetivos; no conviene cuando hay una respuesta correcta comprobable.

**¿Cómo sé si puedo confiar en el juez?**
Midiendo su concordancia con personas. Si las personas no coinciden entre sí, el problema es la rúbrica.

**¿Qué se mide en un sistema RAG?**
Recuperación y fundamentación, por separado. Separarlas es la mitad del diagnóstico.

**¿La evaluación puede bloquear un despliegue?**
Sí, si el umbral es determinista y acordado antes. El puntaje contra el umbral bloquea; la opinión libre del modelo informa.

## Fuentes

Fecha de consulta: 27 de julio de 2026.

**Aportes de la comunidad Underc0de**

1. Underc0de, foro. [Sección Testing automatizado](https://underc0de.org/foro/testing-automatizado/).
2. Underc0de, foro. [Sección Inteligencia artificial](https://underc0de.org/foro/inteligencia-artificial/).

**Documentación oficial e investigación**

3. Anthropic. [Creating strong empirical evaluations](https://platform.claude.com/docs/en/test-and-evaluate/develop-tests).
4. Stanford CRFM. [HELM: Holistic Evaluation of Language Models](https://crfm.stanford.edu/helm/).
5. Stanford CRFM. [Documentación de HELM](https://crfm-helm.readthedocs.io/en/latest/).

## Guías relacionadas

- [Testing de aplicaciones con inteligencia artificial](../../testing/testing-de-aplicaciones-con-inteligencia-artificial/index.md)
- [Cómo crear un sistema RAG con documentos propios](../como-crear-un-sistema-rag-con-documentos-propios/index.md)
- [Inteligencia artificial aplicada a pipelines CI/CD](../../devops-cloud/inteligencia-artificial-en-pipelines-ci-cd/index.md)
- [Índice de Inteligencia artificial](../index.md)
