2026-08-15
Qué debe medir una app de idiomas adaptativa
Una app de idiomas adaptativa debe registrar qué conceptos tocan, qué ejercicio se generó y cómo respondió cada palabra o idea para ajustar la repetición.
Respuesta corta
Una app de idiomas adaptativa debe seguir un ciclo cerrado con tres señales: qué conceptos están pendientes (vocabulario y gramática programados por repetición espaciada), qué ejercicio se generó para esos conceptos y qué pasó a nivel de palabra o concepto cuando el alumno respondió. Si falta una de esas piezas, “adaptativa” suele significar solo una estimación de nivel, una racha o un mazo fijo, no una programación que se actualiza según lo que realmente recuperaste de memoria.
La práctica de recuperación refuerza la memoria cuando el sistema puede atribuir el acierto o el error a elementos concretos, no solo a una lección completa.1 Los programadores modernos como FSRS necesitan calificaciones limpias por elemento para predecir cuándo volverá a fallar un recuerdo.2 LinGoat es un ejemplo de cómo combinar programación por conceptos pendientes, generación de frases nuevas y evaluación granular. La lista de abajo no es un recorrido del producto, sino un mapa de capacidades.
Por qué “adaptativa” es más que una etiqueta de nivel
Muchas apps se presentan como adaptativas porque saltan unidades fáciles, suben la dificultad después de un test o estiman un nivel CEFR. Eso puede personalizar la selección de contenido. Pero no dice, por sí solo, qué conjugaciones o lemas están a punto de olvidarse esta noche.
La repetición espaciada funciona porque interrumpe la curva del olvido a nivel de ítem: cada palabra o concepto gramatical tiene su propio historial de intentos de recuperación.3 Si la app solo guarda “Lección 12: 80%”, no puede reprogramar la preposición que fallaste mientras adelanta cuatro sustantivos sólidos. Por eso, una práctica adaptativa de idiomas productiva tiene que registrar juntos las unidades de memoria, el contexto del ejercicio y los resultados granulares. Si quieres entender la base de este sistema, mira cómo funciona la repetición espaciada.
Qué conceptos están pendientes hoy, y por qué importa
La primera señal es la cola de pendientes: qué conceptos trazados deberían practicarse hoy para que la probabilidad de recuerdo se mantenga cerca de un objetivo de retención. Los sistemas clásicos tipo SM-2 alargan intervalos sobre todo con un factor de facilidad. FSRS modela la dificultad, la estabilidad y la recuperabilidad de cada ítem, y coloca la siguiente revisión cuando la probabilidad de recuerdo se acerca al objetivo.2
Los grandes benchmarks de colecciones de Anki muestran que FSRS predice el recuerdo con más precisión que SM-2 en historiales a nivel de tarjeta, aunque conviene leer esas cifras publicadas como evidencia de un momento concreto, no como una constante eterna.4 En aprendizaje de idiomas esto importa porque los cognados y los verbos irregulares no se olvidan siguiendo la misma curva. Una app adaptativa que “conoce tu nivel” pero no puede decir qué cinco ítems están pendientes no está programando, solo está ordenando contenido. Para una comparación más profunda, mira FSRS frente a SM-2 para aprender idiomas.
Qué ejercicio vio realmente el alumno
La segunda señal es el envoltorio del ejercicio: qué prompt vio el alumno para esos conceptos pendientes. Registrar ese ejercicio importa por dos motivos.
- Auditabilidad: puedes distinguir si un fallo vino de un intento de recuperación justo o de un prompt defectuoso, una acumulación poco natural de ítems o una tarea de reconocimiento que nunca obligó a producir.
- Transferencia: si siempre se reutiliza la misma frase estática, el alumno puede aprobar por reconocer la cadena en vez de recuperar sus piezas. Las frases nuevas que siguen incluyendo conceptos pendientes mantienen la práctica más cerca de la composición real.
Para apps centradas en producción, una buena base es la traducción de la lengua materna a la meta, empaquetando tantos conceptos pendientes como sea posible sin perder naturalidad. La frase es el formato de entrega, la lista de pendientes es el currículo de ese momento. Cómo encajan el empaquetado y la programación se explica en las revisiones de frases con varios conceptos.
Cómo se puntúa cada palabra y cada concepto
La tercera señal es la evaluación granular: cada concepto de vocabulario y gramática dentro del intento se puntúa por separado y luego se escribe de vuelta al programador. Un aprobado o suspendido a nivel de frase contamina el registro. Si fallas una terminación, se castigan cuatro recuerdos correctos; si aciertas casi toda la frase, una forma débil puede colarse como “Bien”. En ambos casos, FSRS, o cualquier modelo por ítem, aprende con etiquetas ruidosas.
La investigación sobre el efecto de prueba trata el propio evento de recuperación como el mecanismo de aprendizaje.13 Para que la práctica con frases alimente ese mecanismo, la app tiene que resolver qué conceptos se recuperaron. Eso es lo que LinGoat llama atribución granular: resultados palabra por palabra, y también gramática por gramática, dentro de un intento de producción completo. Mira la evaluación palabra por palabra para aprender idiomas.
Checklist de capacidades
Úsalo como checklist si vas a comprar o construir una solución. Un ciclo productivo adaptativo es creíble cuando el producto puede mostrar:
- Inventario de conceptos: vocabulario y gramática registrados como elementos separados que se pueden programar, no solo como puntuaciones de lección.
- Cola de pendientes: un conjunto diario o por sesión de conceptos seleccionado por repetición espaciada, idealmente con un modelo calibrado como FSRS y no con bloques fijos de “repasa este capítulo”.
- Generación de ejercicios ligada a los pendientes: prompts construidos a partir del conjunto actual de conceptos pendientes, muchas veces con frases nuevas de varios conceptos, y no una mezcla aleatoria de tarjetas estáticas.
- Exigencia de producción: recuerdo escrito o tecleado sin ayudas de tipo multiple choice, para que el intento sea un evento real de recuperación.
- Notas por concepto: aciertos y fallos atribuidos a cada elemento de la respuesta, con feedback inmediato y localizado.
- Devolución al programador: cada nota actualiza el siguiente intervalo de ese ítem, sin arrastrar piezas ya dominadas por un solo error tipográfico.
- Analítica honesta: progreso medido como dominio activo de conceptos (estabilidad, carga pendiente, tamaño de vocabulario), no solo como rachas o XP.
Si falta cualquiera de esos eslabones, el ciclo se rompe. SRS sin generación invita a memorizar de forma estática. Generación sin notas granulares corrompe la programación. Notas sin cola de pendientes se quedan en un cuestionario aislado.
Dónde se quedan cortas muchas apps
Fallas comunes, incluso en productos pulidos:
- Reconocimiento contado como dominio: las tareas de elegir una opción o emparejar toques parecen datos, pero sobre todo miden reconocimiento, que suele sobreestimar de forma sistemática el recuerdo productivo.
- Tarjetas de frase sin notas por ítem: las revisiones de cadenas completas parecen eficientes hasta que un solo error reinicia cinco intervalos.
- Motores de nivel sin historial por elemento: los tests de colocación adaptan bandas de contenido, pero no mantienen curvas de olvido por lema.
- Métricas de gamificación como sustituto: las rachas y el XP ayudan a sostener la constancia, pero no prueban que los conceptos correctos volvieron en el momento correcto.
Nada de esto vuelve inútil una app. Sí significa que la palabra “adaptativa” está haciendo más trabajo del que hace el modelo de datos.
LinGoat como ejemplo de la combinación
LinGoat implementa el ciclo de tres señales para la práctica escrita con frases: FSRS decide qué conceptos están pendientes, el generador empaqueta esos pendientes en prompts nuevos de traducción de la lengua materna a la meta, y la atribución granular puntúa cada concepto y lo reprograma. La app no sustituye la práctica oral, y los modos de habla dedicados que reutilizan el mismo mapa de dominio pertenecen a la hoja de ruta, no a una afirmación sobre lo que ya está disponible hoy.
Para ver el marco pedagógico completo, producción frente a reconocimiento, el laddering y por qué los tres pasos deben viajar juntos, lee la pedagogía completa de LinGoat.
Mira cómo funciona LinGoat o empieza a practicar.
Referencias
- Roediger, H. L., & Karpicke, J. D. (2006). Test-enhanced learning: Taking memory tests improves long-term retention. Psychological Science, 17(3), 249-255. https://doi.org/10.1111/j.1467-9280.2006.01693.x
- Ye, J., Su, J., & Cao, Y. (2022). A stochastic shortest path algorithm for optimizing spaced repetition scheduling. In Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (pp. 4384-4394). Association for Computing Machinery. https://doi.org/10.1145/3534678.3539081
- Karpicke, J. D., & Roediger, H. L. (2008). The critical importance of retrieval for learning. Science, 319(5865), 966-968. https://doi.org/10.1126/science.1152408
- Expertium. (2025). Benchmark of spaced repetition algorithms. https://expertium.github.io/Benchmark.html