Volver al inicio

Etiquetas XML en prompts para modelos de IA

Las etiquetas XML en prompts mejoran la atención transformer local, delimitando claramente instrucciones, datos y ejemplos. Esto reduce la incertidumbre en contextos largos con atención dispersa. Material con ejemplos de código y patrones para desarrolladores.

Prompts precisos con etiquetas XML para Claude
Advertisement 728x90

Etiquetas XML para Controlar la Atención en Prompts con Precisión

Los modelos basados en transformadores distribuyen la atención por todo el contexto del prompt de una vez, difuminando los límites entre instrucciones, datos y ejemplos. Las etiquetas XML crean anclas semánticas explícitas, fortaleciendo las conexiones dentro de bloques y reduciendo la ambigüedad interpretativa. Esto es especialmente crucial en sesiones largas donde entra en juego la atención dispersa.

Cómo Funciona la Atención en los Transformadores

Los transformadores calculan una matriz de atención para todos los tokens de entrada: cada token evalúa la relevancia de los demás. La atención completa escala de forma cuadrática con la longitud del contexto, por lo que los inputs más largos pasan a atención dispersa: los tokens solo interactúan con vecinos cercanos y anclas globales.

Sin estructura, los prompts se vuelven difusos: el modelo malgasta recursos adivinando límites. Las etiquetas XML forman clústeres pareados con alta atención interna. Los tokens dentro de <data> están fuertemente vinculados entre sí, pero débilmente con <instructions>.

Google AdInline article slot

Con etiquetas anidadas, se construye automáticamente una jerarquía de pesos: las etiquetas externas abarcan clústeres, y las internas manejan subestructuras. Esto aprovecha el preentrenamiento en HTML/XML/código, donde las etiquetas pareadas marcan límites semánticos.

Prompts Con vs. Sin Etiquetas

Considera el mismo contenido:

Sin XML:

Google AdInline article slot
Eres un analista. Aquí tienes los datos de ventas de marzo. Escribe un resumen en tres frases.
Datos: 1200 transacciones, ticket promedio 850 som, churn 12%.
Buen ejemplo de resumen: conciso, con números, sin juicios.

Con XML:

<role>Eres un analista de datos</role>
<data>
  1200 transacciones, ticket promedio 850 som, churn 12%
</data>
<instructions>
  Escribe un resumen en tres frases
</instructions>
<example>
  Conciso, con números, sin juicios
</example>

En el primer caso, la atención se distribuye uniformemente y el modelo adivina secciones. En el segundo, las etiquetas fijan el foco: <data> se agrupa localmente, sin importar la posición.

Para prompts cortos (<512 tokens), la diferencia es mínima. Los beneficios brillan en prompts de 2k+ tokens o en chats: cada intercambio añade contexto, y la atención dispersa fragmenta los enlaces sin anclas.

Google AdInline article slot

Uso en Contextos Largos

Tras 5+ iteraciones, el contexto de la sesión alcanza umbrales de atención dispersa. Los tokens iniciales del diálogo se conectan débilmente con el final sin balizas estructurales. Las etiquetas XML aseguran atención local densa dentro de bloques, preservando la estructura global.

Esta estructura invierte en estabilidad de sesión: las instrucciones iniciales mantienen peso bajo nuevos datos. Es como el método GRACE para documentos: las etiquetas definen las zonas de responsabilidad del modelo.

Patrones Prácticos de Etiquetas XML

Usa etiquetas para contenido mixto. Aquí van plantillas básicas:

  • Instrucciones + Datos:

```

<instructions>Tarea</instructions>

<data>Datos</data>

```

  • Ejemplos:

```

<examples>

<example>Entrada: ... Salida: ...</example>

</examples>

```

  • Rol + Restricciones:

```

<role>Analista</role>

<task>Analiza</task>

<constraints>3 frases, usa números</constraints>

```

Estos patrones funcionan en Claude 4.6 y modelos similares: Anthropic recomienda XML para prompts ambiguos que mezclan instrucciones, contexto y variables.

Lecciones Clave

  • Las etiquetas XML potencian la atención local dentro de bloques, eliminando adivinanzas en límites.
  • Cruciales para atención dispersa en contextos largos (>2k tokens).
  • El anidamiento construye jerarquías de peso automáticamente.
  • Aplícalas a roles, datos, ejemplos y restricciones.
  • Consejo de Anthropic: Úsalas en prompts mixtos, sin explicaciones extra.

— Editorial Team

Advertisement 728x90

Leer después