Com avaluem les eines / Cómo evaluamos las herramientas / How we evaluate tools

Com avaluem les eines

CAIRAI no és un directori més: apliquem un criteri pedagògic explícit i documentat a cada avaluació.

El nostre posicionament

No som un altre directori d'eines d'IA. Cada setmana neixen desenes d'aplicacions que prometen revolucionar l'educació. El que falta no és una llista més llarga: és criteri.

Ens preguntem si una eina ajuda un alumne a pensar millor, o si li estalvia haver de pensar. No partim del tecnooptimisme que assumeix que tota IA millora l'aprenentatge, ni del rebuig que la descarta per principi.

Avaluem, no llistem. Diem quan una eina NO s'ha d'usar, no només quan sí. Som independents: cap posicionament pagat altera una valoració.

Els dos nivells d'avaluació

Cada eina es valora en dues capes: primer els desqualificadors, després els vuit eixos d'avaluació.

Capa 1 — Desqualificadors (banderes vermelles)

Condicions que, si es detecten, marquen l'eina independentment de la resta de la puntuació.

  • Recollida de dades de menors sense garanties clares
  • Absència de límit d'edat o control parental en converses obertes amb menors
  • Patrons de disseny addictiu
  • Publicitat enganyosa sobre les capacitats reals de l'eina
  • Recollida de dades de comportament o veu a l'aula sense transparència

Capa 2 — Vuit eixos d'avaluació

Cada eix respon una pregunta concreta i s'ancora en evidència científica.

Posició cognitiva

Substitueix, complementa o amplia el judici de qui aprèn o ensenya?

Basat en la distinció de l'OCDE (2026) entre substitució, complementarietat i augmentació del judici professional.

Fricció productiva

Genera un espai d'intent abans de donar la resposta, o l'elimina?

Basat en les «dificultats desitjables» de Bjork i el «fracàs productiu» de Kapur.

Disseny educatiu vs. genèric

Està construïda des de la ciència de l'aprenentatge o és un xat genèric adaptat?

L'OCDE (2026) mostra que les eines de propòsit educatiu funcionen millor i de manera més consistent.

Agència i autonomia

Reforça la capacitat de decidir de qui aprèn, o la substitueix silenciosament?

Basat en l'enfocament humanista de la Guia de la UNESCO (2023).

Transparència

Declara el model, les limitacions i les dades d'entrenament?

UNESCO (2023) i el model de valoració de Common Sense Media.

Privadesa i protecció de menors

Compleix RGPD/COPPA i estableix límits d'edat clars?

Recomanació explícita de la Guia de la UNESCO (2023).

Equitat d'accés

Quin és el cost real, la disponibilitat en català i l'accessibilitat?

L'accés desigual amplifica les bretxes educatives existents; ho valorem com a factor propi.

Risc de dany documentat

Hi ha evidència real de dany, no només un risc teòric?

Metodologia de «línia vermella» del Youth AI Safety Institute / Common Sense Media.

Per què la fricció importa

Quan una eina elimina tot l'esforç, sovint elimina també l'aprenentatge. Aquestes són tres dades que orienten el nostre criteri.

  • 666 — participants (Gerlich, 2025, revista Societies): correlació negativa entre l'ús freqüent d'eines d'IA i el pensament crític, mediada per la «descàrrega cognitiva».
  • EEG — MIT Media Lab (Kosmyna et al., 2025): qui va escriure sense cap eina va mostrar la connectivitat cerebral més forta; qui va usar un model de llenguatge, la més feble — un efecte que va persistir després de deixar l'eina.
  • OCDE 2026 — Sense intenció pedagògica clara, l'ús de la IA generativa produeix «mandra metacognitiva»: millora el rendiment immediat sense aprenentatge real.

El nostre judici és expert, no automàtic

La valoració de cada eina és criteri documentat de l'equip aplicat a través d'un marc consistent, no el resultat d'una fórmula matemàtica. Seguim explícitament el model del Youth AI Safety Institute / Common Sense Media, que declara obertament que les seves valoracions reflecteixen judici expert, no un càlcul automàtic.

El procés

  1. Doble avaluador — Cada fitxa la valoren dues persones de manera independent.
  2. Panell assessor extern — Docent, investigador en ciències de l'aprenentatge i expert en protecció de dades revisen la metodologia un cop l'any.
  3. Versionat públic — Cada canvi de criteri es documenta amb data i motiu.
  4. Re-avaluació periòdica — Cada fitxa mostra la data de la darrera revisió.

Fonts i bibliografia

En resum

No busquem la llista més llarga, sinó la decisió més ben fonamentada per a cada aula.

Explora el directori amb aquest criteri

Cómo evaluamos las herramientas

CAIRAI no es un directorio más: aplicamos un criterio pedagógico explícito y documentado en cada evaluación.

Nuestro posicionamiento

No somos otro directorio de herramientas de IA. Cada semana nacen decenas de aplicaciones que prometen revolucionar la educación. Lo que falta no es una lista más larga: es criterio.

Nos preguntamos si una herramienta ayuda a un alumno a pensar mejor, o si le ahorra tener que pensar. No partimos del tecnooptimismo que asume que toda IA mejora el aprendizaje, ni del rechazo que la descarta por principio.

Evaluamos, no listamos. Decimos cuándo una herramienta NO debe usarse, no solo cuándo sí. Somos independientes: ningún posicionamiento pagado altera una valoración.

Los dos niveles de evaluación

Cada herramienta se valora en dos capas: primero los descalificadores, después los ocho ejes de evaluación.

Capa 1 — Descalificadores (banderas rojas)

Condiciones que, si se detectan, marcan la herramienta con independencia del resto de la puntuación.

  • Recogida de datos de menores sin garantías claras
  • Ausencia de límite de edad o control parental en conversaciones abiertas con menores
  • Patrones de diseño adictivo
  • Publicidad engañosa sobre las capacidades reales de la herramienta
  • Recogida de datos de comportamiento o voz en el aula sin transparencia

Capa 2 — Ocho ejes de evaluación

Cada eje responde una pregunta concreta y se ancla en evidencia científica.

Posición cognitiva

¿Sustituye, complementa o amplía el juicio de quien aprende o enseña?

Basado en la distinción de la OCDE (2026) entre sustitución, complementariedad y aumento del juicio profesional.

Fricción productiva

¿Genera un espacio de intento antes de dar la respuesta, o lo elimina?

Basado en las «dificultades deseables» de Bjork y el «fracaso productivo» de Kapur.

Diseño educativo vs. genérico

¿Está construida desde la ciencia del aprendizaje o es un chat genérico adaptado?

La OCDE (2026) muestra que las herramientas de propósito educativo funcionan mejor y de forma más consistente.

Agencia y autonomía

¿Refuerza la capacidad de decidir de quien aprende, o la sustituye en silencio?

Basado en el enfoque humanista de la Guía de la UNESCO (2023).

Transparencia

¿Declara el modelo, las limitaciones y los datos de entrenamiento?

UNESCO (2023) y el modelo de valoración de Common Sense Media.

Privacidad y protección de menores

¿Cumple RGPD/COPPA y establece límites de edad claros?

Recomendación explícita de la Guía de la UNESCO (2023).

Equidad de acceso

¿Cuál es el coste real, la disponibilidad en catalán y la accesibilidad?

El acceso desigual amplifica las brechas educativas existentes; lo valoramos como factor propio.

Riesgo de daño documentado

¿Hay evidencia real de daño, no solo un riesgo teórico?

Metodología de «línea roja» del Youth AI Safety Institute / Common Sense Media.

Por qué la fricción importa

Cuando una herramienta elimina todo el esfuerzo, a menudo elimina también el aprendizaje. Estos son tres datos que orientan nuestro criterio.

  • 666 — participantes (Gerlich, 2025, revista Societies): correlación negativa entre el uso frecuente de herramientas de IA y el pensamiento crítico, mediada por la «descarga cognitiva».
  • EEG — MIT Media Lab (Kosmyna et al., 2025): quienes escribieron sin herramienta mostraron la conectividad cerebral más fuerte; quienes usaron un modelo de lenguaje, la más débil — un efecto que persistió tras dejar la herramienta.
  • OCDE 2026 — Sin intención pedagógica clara, el uso de la IA generativa produce «pereza metacognitiva»: mejora el rendimiento inmediato sin aprendizaje real.

Nuestro juicio es experto, no automático

La valoración de cada herramienta es criterio documentado del equipo aplicado mediante un marco consistente, no el resultado de una fórmula matemática. Seguimos explícitamente el modelo del Youth AI Safety Institute / Common Sense Media, que declara abiertamente que sus valoraciones reflejan juicio experto, no un cálculo automático.

El proceso

  1. Doble evaluador — Cada ficha la valoran dos personas de forma independiente.
  2. Panel asesor externo — Docente, investigador en ciencias del aprendizaje y experto en protección de datos revisan la metodología una vez al año.
  3. Versionado público — Cada cambio de criterio se documenta con fecha y motivo.
  4. Reevaluación periódica — Cada ficha muestra la fecha de la última revisión.

Fuentes y bibliografía

En resumen

No buscamos la lista más larga, sino la decisión mejor fundamentada para cada aula.

Explora el directorio con este criterio

How we evaluate tools

CAIRAI is not just another directory: we apply explicit, documented pedagogical criteria to every evaluation.

Where we stand

We are not another AI tools directory. Every week dozens of apps promise to revolutionise education. What is missing is not a longer list: it is judgement.

We ask whether a tool helps a student think better, or saves them from having to think at all. We start neither from techno-optimism, which assumes all AI improves learning, nor from blanket rejection.

We evaluate, we don't just list. We say when a tool should NOT be used, not only when it should. We are independent: no paid placement changes a rating.

The two levels of evaluation

Every tool is assessed in two layers: first the disqualifiers, then the eight evaluation axes.

Layer 1 — Disqualifiers (red flags)

Conditions that, when detected, flag the tool regardless of the rest of the score.

  • Collection of minors' data without clear safeguards
  • No age limit or parental control in open conversations with minors
  • Addictive design patterns
  • Misleading marketing about the tool's real capabilities
  • Collection of classroom behaviour or voice data without transparency

Layer 2 — Eight evaluation axes

Each axis answers a specific question and is anchored in scientific evidence.

Cognitive stance

Does it replace, complement or extend the judgement of the learner or teacher?

Based on the OECD (2026) distinction between substitution, complementarity and augmentation of professional judgement.

Productive friction

Does it create room for an attempt before giving the answer, or remove it?

Based on Bjork's "desirable difficulties" and Kapur's "productive failure".

Educational vs. generic design

Is it built on learning science, or a generic chatbot repackaged?

The OECD (2026) shows purpose-built educational tools work better and more consistently.

Agency and autonomy

Does it strengthen the learner's capacity to decide, or quietly replace it?

Based on the humanistic approach of the UNESCO Guidance (2023).

Transparency

Does it disclose the model, its limitations and its training data?

UNESCO (2023) and the Common Sense Media rating model.

Privacy and child protection

Does it comply with GDPR/COPPA and set clear age limits?

An explicit recommendation of the UNESCO Guidance (2023).

Equity of access

What is the real cost, language availability and accessibility?

Unequal access amplifies existing educational gaps, so we score it as a factor in its own right.

Documented harm risk

Is there real evidence of harm, not just theoretical risk?

"Red line" methodology from the Youth AI Safety Institute / Common Sense Media.

Why friction matters

When a tool removes all effort, it often removes the learning too. Three findings shape our criteria.

  • 666 — participants (Gerlich, 2025, Societies): a negative correlation between frequent AI tool use and critical thinking, mediated by cognitive offloading.
  • EEG — MIT Media Lab (Kosmyna et al., 2025): people writing with no tool showed the strongest brain connectivity; those using a language model, the weakest — an effect that persisted after they stopped using it.
  • OECD 2026 — Without a clear pedagogical intent, generative AI use produces "metacognitive laziness": better immediate performance without real learning.

Our judgement is expert, not automatic

Each rating is documented team judgement applied through a consistent framework, not the output of a mathematical formula. We explicitly follow the Youth AI Safety Institute / Common Sense Media model, which openly states that its ratings reflect expert judgement rather than an automatic calculation.

The process

  1. Two reviewers — Every entry is rated independently by two people.
  2. External advisory panel — A teacher, a learning-sciences researcher and a data-protection expert review the methodology once a year.
  3. Public versioning — Every change of criteria is documented with date and reason.
  4. Periodic re-evaluation — Every entry shows the date of its last review.

Sources and bibliography

In short

We are not after the longest list, but the best-grounded decision for each classroom.

Browse the directory with this criteria

Directori d'eines d'IA per a l'educació