Volver al blog

2026-08-05

Cómo evaluar palabra por palabra en SRS

La evaluación por concepto permite que el SRS reprograme solo lo que falló y no castigue ni premie de más una frase entera en cada intento de producción.

La idea clave

La evaluación palabra por palabra importa en repetición espaciada porque los algoritmos de SRS programan elementos, no frases completas. Si marcas toda una oración como incorrecta cuando solo falló una palabra, castigas conceptos que sí recuerdas. Si la marcas como correcta cuando solo se te escapó una forma gramatical, le das un pase gratis al punto débil. En ambos casos, la programación se aleja de lo que realmente sabes.

La atribución por concepto, que en LinGoat se llama atribución granular, evalúa por separado cada concepto de vocabulario y gramática dentro de la frase y luego pasa esos resultados al programador. Así, la práctica con oraciones de varios elementos puede seguir funcionando con tiempos tipo FSRS en lugar de pelearse con ellos. Si quieres ver el sistema completo, consulta la pedagogía completa de LinGoat y cómo funciona la repetición espaciada.

Qué significa evaluar palabra por palabra

En un ejercicio de traducción, produces una frase completa en el idioma meta. La evaluación palabra por palabra no se queda en un simple “correcto” o “incorrecto” para toda la cadena. En cambio, asigna aciertos o errores a cada concepto que se está midiendo dentro de esa frase: una forma verbal, una preposición, un sustantivo, un marcador de tiempo verbal, y así sucesivamente.

atribución granular es el nombre que usa LinGoat para ese paso. Para el alumno, la idea es simple: debes saber qué falló, y la app debe reprogramar eso. La corrección inmediata y localizada también te ayuda a actualizar la hipótesis que acabas de poner a prueba, en vez de quedarte con la vaga sensación de que “la frase estaba mal”.

Por qué el aprobado o suspenso de toda la frase rompe el SRS

La repetición espaciada parte de una premisa: cada repaso debe dar una señal limpia sobre una sola memoria. Los programadores modernos, como FSRS, modelan la recuperabilidad, la estabilidad y la dificultad por elemento, y actualizan esas variables a partir de la nota que recibe ese elemento.1 Una oración que reúne cinco conceptos por repasar en un solo ejercicio es eficiente para practicar, pero solo si el sistema puede repartir el resultado en cinco partes.

El aprobado o suspenso global convierte esas cinco señales en un solo bit:

  • Falsos fallos: te equivocas en una terminación y cuatro palabras sólidas quedan tratadas como si se hubieran olvidado. Los intervalos se acortan para material que ya recuperas bien. La carga de repaso sube por motivos equivocados.
  • Falsos aciertos: clavas casi toda la oración y el concepto frágil se cuela como si estuviera “bien”. El programador alarga el intervalo de ese elemento. Lo vuelves a ver demasiado tarde.
  • Promedios inútiles: incluso una nota intermedia, como “Difícil” para toda la frase, no le dice a FSRS qué concepto fue el difícil. Las actualizaciones de dificultad y estabilidad se mezclan entre recuerdos que no tienen relación.

No es solo una preferencia de interfaz. Es un problema de integridad de datos. Las apps adaptativas que dicen medir dominio real necesitan resultados a nivel de elemento, no un pulgar arriba o abajo para toda la oración. Mira también qué deberían medir las apps de idiomas adaptativas.

Qué necesita FSRS en cada repaso

FSRS, y modelos similares de repetición espaciada, solo funcionan tan bien como el registro de repaso que reciben. Ye, Su y Cao (2022) presentan la programación como un problema de cuándo volver a preguntar para que la probabilidad prevista de recuerdo se mantenga cerca de un objetivo de retención.1 Esa optimización supone que cada nota registrada corresponde a una unidad de memoria concreta.

Los benchmarks que comparan FSRS con heurísticas antiguas tipo SM-2 también evalúan el error de predicción sobre historiales de revisión de tarjetas, no sobre puntuaciones sin etiquetar de un párrafo.2 Si tus “tarjetas” son en realidad frases con varios conceptos y solo guardas aprobado o suspendido para el bloque entero, estás pidiendo a un modelo por elemento que aprenda con etiquetas corruptas.

La investigación sobre práctica de recuperación apunta en la misma dirección desde el lado del aprendizaje: el evento que fortalece la memoria es el intento de recuperar la información que te importa, no una impresión general sobre un párrafo.3 La producción de frases puede seguir siendo el formato del ejercicio. La capa de evaluación tiene que resolver qué conceptos sí se recuperaron y cuáles no.

Una comparación útil: las reformulaciones en adultos

En el desarrollo de la lengua materna, los cuidadores suelen reformular un error con una corrección localizada, un recast: el niño dice “I eated” y el adulto responde “you ate”. La investigación sobre esas reformulaciones en adultos las trata como evidencia negativa que ayuda a revisar hipótesis estructurales.4

Los adultos que aprenden idiomas rara vez reciben miles de recasts al día. La evaluación palabra por palabra en producción escrita no es lo mismo que el habla de un cuidador, pero cumple una función parecida: localiza el fallo para que puedas actualizar la regla correcta en vez de desechar todo el intento. LinGoat usa esa señal tanto para programar como para dar feedback. Es práctica escrita con frases y SRS, no una afirmación de que la app sustituya a los interlocutores reales.

Cómo encaja esto con la traducción y las frases con varios conceptos

La atribución granular es lo que permite que los ejercicios de traducción alimenten un programador. Traducir te obliga a intentar los conceptos que tocan, en vez de evitarlos. La evaluación palabra por palabra convierte ese intento forzado en resultados limpios por concepto.

La misma lógica desbloquea los repasos con frases de varios conceptos: meter varios elementos vencidos en una sola oración natural ahorra tiempo solo cuando cada elemento puede acertar o fallar por separado. Sin esa separación, lo que parece eficiencia se convierte en contaminación eficiente.

LinGoat genera frases nuevas alrededor de tus conceptos pendientes, evalúa cada concepto por separado y programa con FSRS. Esa combinación es el ciclo central: espaciado, producción y atribución granular trabajando juntos. Mira cómo funciona LinGoat o empieza a practicar.

Referencias

  1. Ye, J., Su, J., & Cao, Y. (2022). A stochastic shortest path algorithm for optimizing spaced repetition scheduling. In Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (pp. 4384-4394). Association for Computing Machinery. https://doi.org/10.1145/3534678.3539081
  2. Expertium. (2025). Benchmark of spaced repetition algorithms. https://expertium.github.io/Benchmark.html
  3. Roediger, H. L., & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249-255. https://doi.org/10.1111/j.1467-9280.2006.01693.x
  4. Chouinard, M. M., & Clark, E. V. (2003). Adult reformulations of child errors as negative evidence. Journal of Child Language, 30(3), 637-669. https://doi.org/10.1017/S0305000903005701