2026-08-07
FSRS vs SM-2 para aprender idiomas
FSRS predice mejor el recuerdo que SM-2 en el aprendizaje de idiomas, reduce repasos innecesarios y mantiene alta la retención con menos desgaste diario.
Respuesta corta
FSRS es una mejor opción que el clásico SM-2 para aprender idiomas, porque estima la probabilidad de recordar cada elemento y programa el siguiente repaso cerca de su punto de olvido. SM-2, en cambio, se apoya sobre todo en una regla de factor de facilidad y multiplicación de intervalos. Funciona, pero no modela la probabilidad de recuerdo ficha por ficha.
En grandes benchmarks de colecciones de Anki, FSRS-6 mostró aproximadamente un 4,37% de RMSE (bins) frente a un 14,84% de Anki SM-2, y una tasa de superioridad del 99,6% (menor log loss para casi todos los usuarios). Toma esas cifras como una foto pública de referencia, no como una constante eterna.1 Para vocabulario y gramática con dificultades muy desiguales, mejores predicciones significan menos repasos desperdiciados en cognados fáciles y menos fallos tardíos en conjugaciones rebeldes. Para una explicación más general del modelo de memoria, mira cómo funciona la repetición espaciada; para objetivos de retención y ajustes, mira cómo optimizar la repetición espaciada.
Por qué SM-2 se queda corto
SM-2 (SuperMemo-2) es el algoritmo veterano detrás de la programación clásica de Anki y de muchas apps de tarjetas. Después de cada repaso eliges una calificación. El sistema actualiza un factor de facilidad y multiplica el intervalo anterior para decidir la próxima fecha. Un "Good" alarga el salto, y un "Again" te devuelve a intervalos cortos.
Es un diseño simple y sorprendentemente eficaz. Pero sigue siendo una pila de heurísticas, no un modelo calibrado de memoria. SM-2 no mantiene una probabilidad explícita de recuerdo para cada tarjeta. Parte de la idea de que multiplicar intervalos por facilidad acabará dejando una cadencia útil para una persona promedio. Cuando la dificultad cambia mucho entre elementos, o cuando las calificaciones son ruidosas, la facilidad se desajusta. Las tarjetas pueden quedarse atrapadas en una especie de "infierno de facilidad" con intervalos demasiado cortos, o estirarse demasiado y fallar cuando vuelven a aparecer.
El benchmark de Expertium señala una salvedad importante de equidad: SM-2 no fue creado para producir probabilidades. Por eso los benchmarks convierten sus intervalos en predicciones de recuerdo con supuestos extra para poder compararlo con modelos modernos.1 Incluso con esa conversión, SM-2 queda por detrás de los programadores DSR bien calibrados en error de predicción.
FSRS y el modelo DSR de memoria
FSRS sigue tres variables de estado por elemento, a menudo llamadas el modelo DSR:
- Dificultad (D): lo difícil que suele ser el elemento para ti.
- Estabilidad (S): lo despacio que cae tu probabilidad de recuerdo, es decir, cuántos días pasan hasta que la recuperabilidad baje a un nivel de referencia.
- Recuperabilidad (R): tu probabilidad estimada de recordar ahora mismo.
Cuando repasas, FSRS actualiza esas variables a partir de tu nota y programa la siguiente aparición cuando R se espera que llegue a tu retención objetivo, a menudo alrededor del 90%. Ye, Su y Cao (2022) formalizan la programación de repetición espaciada como una optimización del coste de repaso frente a un modelo de memoria entrenado con grandes registros de usuarios, en lugar de depender solo de multiplicadores fijos.2
Este artículo compara ambos enfoques para estudiantes de idiomas, no es un tutorial completo de FSRS. Si quieres ver definiciones de DSR, personalización con aprendizaje automático y por qué los aciertos difíciles aumentan más la estabilidad que los fáciles, lee cómo funciona la repetición espaciada. Si quieres elegir una retención adecuada y evitar errores típicos de ajuste, lee cómo optimizar la repetición espaciada.
Qué significan de verdad los números del benchmark
El benchmark público de Expertium evalúa algoritmos de repetición espaciada sobre miles de colecciones de Anki y cientos de millones de eventos de repaso (en el informe se usa del orden de ~350 millones de repasos filtrados para la evaluación).1 Para quienes aprenden, importan tres ideas:
- RMSE (bins) mide la calibración, o sea, lo cerca que está la probabilidad de recuerdo predicha de la retención observada en repasos agrupados. Cuanto más bajo, mejor. Las cifras de referencia más citadas para FSRS-6 frente a Anki SM-2 son aproximadamente 4,37% frente a 14,84%.
- Log loss evalúa qué tan bien encaja cada probabilidad predicha con el resultado binario real, recordado o olvidado. Cuanto más bajo, mejor.
- Superiority es la proporción de usuarios para quienes el algoritmo A tiene menor log loss que el algoritmo B. FSRS-6, con ponderación por recencia, muestra un 99,6% de superioridad frente a Anki SM-2 en esa matriz.
Esos números pueden moverse cuando cambian los datos, los filtros o la versión del algoritmo. Úsalos como evidencia de que los programadores DSR modernos predicen el recuerdo mucho mejor que las heurísticas al estilo SM-2 sobre historiales reales de repaso, no como una garantía de que tu mazo personal vaya a reducirse un porcentaje fijo mañana.
Por qué esto importa más en idiomas
Los mazos de idiomas no son uniformes. Un cognado en español como animal y una forma verbal irregular como fue no se olvidan en la misma curva. La lógica de facilidad compartida de SM-2 suele repasar demasiado los elementos fáciles y proteger poco los difíciles. La dificultad y la estabilidad por elemento de FSRS permiten que los intervalos diverjan: las palabras sólidas se espacian más, y la gramática frágil se mantiene más cerca.
Eso cuenta el doble cuando practicas producción:
- Carga de repaso: Programar de más lo que ya dominas consume los minutos que necesitas para escribir frases completas. Programar de menos lo difícil provoca fallos sorpresa justo cuando intentas construir una frase.
- Señales honestas: La repetición espaciada solo funciona si cada nota refleja una sola unidad de memoria. Si una frase incluye varias palabras que vencen hoy y solo guardas aprobado o fallado para toda la cadena, cualquier programador, FSRS o SM-2, recibe etiquetas corruptas. La evaluación por concepto es la mitad que falta; mira evaluación palabra por palabra para aprender idiomas.
En resumen: FSRS mejora cuándo preguntar. La atribución granular mejora qué se está preguntando. Las apps de idiomas que combinan ambas cosas pueden programar vocabulario y gramática dentro de frases nuevas sin castigar lo que ya conoces por una sola errata.
Lo que FSRS no sustituye
Un algoritmo mejor no convierte un test de reconocimiento en fluidez. FSRS programa eventos de recuperación, pero no inventa el formato de ejercicio adecuado. La opción múltiple sigue midiendo reconocimiento. La minería de frases estáticas sigue atando la memoria a una sola cadena. Y las preguntas abiertas, sin una presión real, te permiten evitar justo el concepto que tocaba hoy.
LinGoat usa FSRS para decidir cuándo repasar palabras y conceptos gramaticales, y después genera traducciones de frases de la lengua materna al idioma objetivo que meten los elementos pendientes dentro de frases naturales nuevas, corrigiendo cada concepto por separado. Eso es práctica activa escrita más SRS, no un sustituto de hablar. El ciclo completo está explicado en la pedagogía completa de LinGoat.
Mira cómo funciona LinGoat o empieza a practicar.
Referencias
- Expertium. Benchmark of spaced repetition algorithms. https://expertium.github.io/Benchmark.html (las cifras de RMSE y superioridad se citan como una captura pública de fecha concreta; los valores pueden cambiar cuando el benchmark se actualiza).
- Ye, J., Su, J., & Cao, Y. (2022). A Stochastic Shortest Path Algorithm for Optimizing Spaced Repetition Scheduling. Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 4381-4390. https://doi.org/10.1145/3534678.3539081