00/08 Portada

Índice

01 Resumen 02 Justificación 03 Tema y objetivos 04 Fundamentación teórica 05 Fundamentación metodológica 06 Limitaciones y líneas futuras 07 Plan de trabajo y cronograma 08 Bibliografía
Plan de investigación · Doctorado en Psicología

De la codificación humana a la codificación automatizada

Validación del sistema de categorías de respuesta verbal del psicoterapeuta mediante modelos de IA

Eric Cozodoy · Doctorando Dr. Luis Botella · Director Grup de Recerca en Psicologia, Persona i Context FPCEE Blanquerna · URL
Explorar el plan
01
01Resumen

Enseñarle a un modelo de IA a leer lo que hace un terapeuta

Esta tesis evalúa si la inteligencia artificial puede automatizar, con una fiabilidad equivalente a la humana, la codificación de las intervenciones verbales del psicoterapeuta — desde una epistemología que entiende la terapia como construcción conjunta de significado.

Se usará el sistema de categorías de Hill (HSS; Hill, 2020), panteórico, con doce categorías en tres dominios. Un conjunto pluralista de series de seis sesiones grabadas será codificado en paralelo por jueces humanos y por modelos de IA; el grado de acuerdo entre ambos determinará la validez y viabilidad de la automatización. De forma exploratoria, se analizará también cómo evolucionan esas categorías a lo largo de cada serie, distinguiendo lo que responde a la orientación teórica de lo que responde al terapeuta concreto.

0
series de 6 sesiones
0
sesiones grabadas
0
categorías, en 3 dominios
0
inferencia local, privacidad total
02
02Justificación

Un hueco entre tres carencias

La psicoterapia funciona, y las distintas orientaciones rinden de forma similar entre sí (Wampold & Imel, 2015). Eso desplaza el interés hacia el efecto del terapeuta: profesionales comparables logran resultados distintos (Wampold & Brown, 2005) — sin que sepamos aún en qué consiste esa diferencia.

Estudiarlo exige mirar qué hace el terapeuta en sesión, de ahí la codificación de su conducta verbal (Orlinsky et al., 2004). Este estudio usa el sistema de Hill por su continuidad de cuatro décadas y su vocación panteórica — pero codificarlo a mano es costoso, y ningún trabajo reciente de automatización con LLM lo ha validado todavía sobre este instrumento ni con una arquitectura íntegramente local.

Carencia 01

No existe una validación del sistema de Hill mediante modelos de IA.

Carencia 02

No existe una arquitectura íntegramente local que garantice máxima privacidad clínica.

Carencia 03

La adecuación del sistema solo se probó en sesiones únicas, no en series completas con la versión actual.

03
03Tema y objetivos

Qué se codifica, y con qué criterio

Validación metodológica de la codificación automatizada de respuestas verbales del terapeuta en series completas, con un componente exploratorio: contrastar la adecuación del sistema entre orientaciones y describir sus fuentes de variación.

Objetivo general

Evaluar la viabilidad y validez de codificar, con modelos de IA ejecutados localmente, las respuestas del terapeuta según el sistema de Hill — tomando la codificación humana como referencia.

1

Estándar humano de referencia

Dos jueces independientes fijan el nivel de detalle categorial fiable.

2

Desidentificación 100% local

Pipeline alineado con RGPD e HIPAA, sin servicios externos.

3

Modelos de pesos abiertos

Varias familias de LLM locales, bajo distintas configuraciones.

4

Comparación de acuerdo

Humano-IA, entre modelos, y estabilidad ante variaciones del procedimiento.

5

Adecuación descriptiva

Capacidad de clasificar sin recurrir en exceso a la categoría residual.

6

Distribución de dominios

Patrones congruentes con la orientación vs. atribuibles al terapeuta.

7

Eficiencia computacional

Requisitos de hardware de cada configuración local.

Preguntas de investigación

P1

¿Cuánto coinciden dos jueces humanos, y con qué nivel de detalle?

P2

¿Se puede desidentificar el corpus sin servicios externos, con riesgo residual aceptable?

P3

¿Cuánto reproducen los modelos locales la codificación humana?

P4

¿Describe el sistema de Hill a terapeutas de orientaciones distintas sin abusar de categoría residual?

P5

¿La distribución de dominios por serie encaja con la orientación declarada — y dónde no?

P6

¿Qué configuración equilibra mejor acuerdo, robustez y eficiencia en local?

04
04Fundamentación teórica

Cuatro piezas del marco conceptual

4.1

La epistemología constructivista-relacional

El estudio parte del marco de Luis Botella (Botella & Gallifa, 1995; Botella & Herrero, 2000; Botella, 2001; Botella et al., 2004): el significado no se descubre, se construye activamente y en el lenguaje compartido con otros. La psicoterapia es un diálogo colaborativo y no un tratamiento administrado por un experto a un receptor pasivo, sino una conversación en la que el terapeuta es coinvestigador de los significados.

«El terapeuta como tejedor de historias.»Botella, 2001

Construcción activa de significado
Orientación activa hacia la búsqueda de sentido.
El significado como logro lingüístico
Se organiza en el lenguaje y permanece abierto a reinterpretación.
El conocimiento como logro social
Pautado por formas de inteligibilidad compartidas.
Constitución conversacional del yo
Las conversaciones tienen fuerza constitutiva sobre el autoconcepto.
Identidad como proceso narrativo
Identidad personal = autoría narrativa sobre la propia biografía.

Es una metateoría (Feixas, 1991), no una escuela más: pone en diálogo tradiciones que rara vez se hablan entre sí, sin declarar a ninguna la única verdad.

Cognitivo-conductualPsicoanálisis relacionalSistémicaCentrada en la personaFactores comunes
Botella ha extendido esta epistemología a la IA generativa (TCI, MCB-FRP; Therapy Process Navigator). Con Saúl (2026) propone tres criterios éticos para su uso clínico — coherencia epistemológica, centralidad de la relación, responsabilidad compartida — que orientan el diseño ético de este estudio (5.6).
4.2

El efecto del terapeuta y la investigación de proceso

El efecto del terapeuta describe la variabilidad entre profesionales comparables, pero no explica en qué consiste (Wampold & Owen, 2021). La investigación de proceso desplaza la pregunta hacia qué ocurre realmente en sesión — y codificar la conducta verbal es la vía empírica más directa (Russell & Stiles, 1979).

Un matiz importante: la orientación declarada no absorbe esa variación. Terapeutas de la misma escuela difieren entre sí de forma sistemática (Wampold & Brown, 2005) — este estudio mantiene ambas explicaciones abiertas (4.3, 5.1).

4.3

El sistema de categorías de Hill

El Helping Skills System (HSS; Hill, 2020) organiza doce categorías, mutuamente excluyentes, en tres dominios — construidos deliberadamente a partir de tres orientaciones clínicas mayores. Hill describe el recorrido como conducir al cliente «hacia dentro y hacia abajo» para comprenderse, y luego «hacia fuera y hacia arriba» para actuar.

« hacia dentro y abajohacia fuera y arriba »
Centrada en la persona

Exploración

Apoya y facilita la exploración de pensamientos, sentimientos y conductas
Conductas no verbales, conductas verbales mínimas, reformulaciones, reflejos de sentimientos, revelaciones de sentimientos y preguntas abiertas
Psicodinámica

Insight

Fomenta la comprensión de las razones subyacentes a los pensamientos, sentimientos y conductas
Desafíos, preguntas abiertas para insight, interpretaciones, revelaciones de insight e inmediatez
Conductual

Acción

Facilita la acción
Preguntas abiertas para la acción, información, orientación sobre el proceso, orientación directa y revelaciones de estrategias
Categoría residual

Other

Incluye intervenciones no relacionadas con los problemas del cliente.
Saludos, despedidas, conversación trivial y comentarios sobre el entorno o acontecimientos.

Adaptado de Hill, 2020, Exhibit 2.1.

«Panteórico» significa inclusivo — no predice parecido entre terapeutas. Hill, Thames y Rardin (1979) lo confirmaron codificando a Rogers, Perls y Ellis con una misma cliente: perfiles radicalmente distintos, pero todos bien descritos por el sistema.

Rogers
53% minimal encourager
Ellis
30% information
21% direct guidance
Perls
19% direct guidance + repertorio amplio

Hill, Thames y Rardin (1979), sobre Three Approaches to Psychotherapy (Shostrum, 1966).

Nivel 1 · Adecuación descriptiva

¿Clasifican las doce categorías toda la conducta verbal, con pocos residuales, en cualquier orientación? Esto no dice si los terapeutas se parecen — dice que el instrumento sirve para compararlos.

Nivel 2 · Fuentes de variación

Orientación declarada vs. efecto del terapeuta: dos explicaciones plausibles que este estudio no puede separar de forma concluyente (5.1).

4.4

El estado de la automatización con IA

Tras los primeros clasificadores entrenados a medida (Carcone et al., 2019: κ = .64), los LLM preentrenados marcan un cambio de paradigma. Tres estudios recientes son los precedentes más cercanos — ninguno usa el sistema de Hill ni una arquitectura 100% local.

EstudioObjetoArquitecturaAcuerdoEste estudio
Hammerfald et al. (2025)8 microcounseling skills, GPT-4.1 ajustadoAPI comercialκ=.69 vs. .54–.59 humano Sistema de Hill sobre conducta del terapeuta, LLM de pesos abiertos 100% local. Meta: κ>.60 humano-humano, acuerdo modelo≈humano.
Baldo et al. (2026)Ontología propia, 10 movimientosLLM juez + voto mayoritarioα≈.63, iguala humano
Yim et al. (2026)Experiencing Scale (cliente)Desidentificación local + nubeNo reportado

Los tres coinciden en un patrón: el acuerdo humano-humano rara vez supera lo moderado-sustancial, y el LLM se degrada en categorías ambiguas — con independencia de la taxonomía. Baldo et al. (2026) advierten, además, que taxonomías como la de Hill se diseñaron para formación humana, no para sistemas automatizados; el diseño del apartado 5 intenta tenerlo en cuenta.

05
05Fundamentación metodológica

Cómo se hace, paso a paso

5.1

Diseño

Diseño observacional sobre material de archivo, sin intervención sobre pacientes reales. Combina dos lógicas: validación metodológica (¿reproduce la IA al codificador humano?) y un diseño de casos múltiples exploratorio (¿cómo varían los dominios por serie?).

Cada serie confunde terapeuta, cliente y orientación entre sí — ninguna diferencia entre series puede atribuirse de forma inequívoca a una sola de esas variables. Por eso todo el análisis de distribución se trata como evidencia exploratoria, nunca confirmatoria.

5.2

Muestra

El corpus de partida comprende ~24 series de seis sesiones (~144 sesiones en total), procedentes de la colección APA Psychotherapy in Six Sessions (Alexander Street). El terapeuta y el cliente se mantienen constantes dentro de cada serie y, previsiblemente, cada serie representa una orientación clínica distinta. Baker et al. (2022) y Diaz et al. (2023) ya utilizaron este corpus para codificar el afecto, pero no la conducta verbal del terapeuta, lo que respalda su idoneidad para el presente estudio sin solapamiento con la variable aquí analizada.

1966
Rogers, Perls y Ellis atienden a una misma cliente (Shostrum).
1979
Hill, Thames y Rardin ponen a prueba el sistema.
2022
The Next Generation: Beck, Greenberg, McWilliams.
2026 →
Esta tesis: HSS revisado + codificación automatizada.

Continuidad directa con el precedente de 1979 que puso a prueba el sistema por primera vez.

5.3

Instrumento

Nivel primario: las doce categorías del HSS. Las subcategorías se usan solo si la fiabilidad humana lo permite. Unidad de análisis: la oración gramatical del terapeuta — más exigente que el turno de habla completo usado en otros estudios automatizados (p. ej. Baldo et al., 2026), pero comparable con la tradición del instrumento.

5.4

Procedimiento en cuatro fases

Fase 1

Desidentificación

Presidio + spaCy, HIPAA + RGPD
+
Procedimiento en Python de dos niveles: identificadores directos (HIPAA Safe Harbor, 45 C.F.R. § 164.514) e información contextual singularizante, con generalización/supresión. Evaluado en precisión, exhaustividad y F1; revisión humana iterativa de casos ambiguos. Solo el corpus protegido avanza.
Produce Corpus protegido
Fase 2

Codificación humana

2 jueces, independiente
+
Dos jueces entrenados iterativamente (práctica, retroalimentación sobre desacuerdos, repetición) codifican por separado. Kappa de Cohen sobre una submuestra piloto decide el nivel de detalle categorial. Desacuerdos persistentes se resuelven por consenso.
Produce Estándar de referencia humano
Fase 3

Codificación automatizada

LLM locales, MacBook M4
+
Inferencia 100% local (Apple M4, 16 GB), sin API comerciales — a diferencia de Yim et al. (2026). Tres familias de modelos de pesos abiertos; zero-shot y few-shot; contexto de intervención aislada, intercambio o sesión completa. Registro exhaustivo de cada ejecución.
Produce Codificación por modelo y configuración
Fase 4

Análisis comparativo

Acuerdo + variación
+
Kappa de Cohen/Fleiss o alfa de Krippendorff, precisión, exhaustividad, F1 y matrices de confusión. Más los dos niveles del apartado 4.3: adecuación descriptiva y atribución de la variación observada.
Produce Resultados de validación y exploración

Toca cada fase para ver el detalle. Las fases 2 y 3 requieren solapamiento: la fiabilidad humana condiciona el nivel de detalle automatizado.

5.5

Hipótesis

H1Fiabilidad humana

Acuerdo entre jueces al menos moderado-sustancial (κ>.60), congruente con Hill et al. (1979): κ .68–.73.

H2Equivalencia IA-humano

Al menos un modelo alcanzará, en categorías principales, un acuerdo comparable al humano-humano.

H3Casos difíciles

Más variabilidad en subcategorías, y en reformulación, reflejo, interpretación y confrontación.

H4Adecuación descriptiva

Pocos residuales y fiabilidad comparable en las series, sin importar la orientación.

H5Congruencia teórica

Más insight en psicodinámicas, más acción en cognitivo-conductuales, más exploración en humanistas.

H6Efecto del terapeuta

Algunas series invertirán lo esperado por su escuela — candidatas al efecto del terapeuta, sin atribución concluyente.

5.6

Aspectos éticos

Material con licencia académica. Tres modalidades de datos, con un único sentido de flujo permitido:

Datos originales
Datos protegidos
Resultados
✕ sin flujo
Terceros / nube comercial

Trazabilidad completa de cada resultado; las transcripciones originales se eliminan al finalizar la tesis.

01

Coherencia epistemológica

La codificación humana es siempre el criterio de referencia, nunca al revés.

02

Centralidad de la relación

Los jueces humanos, no el modelo, resuelven los casos ambiguos.

03

Responsabilidad compartida

Trazabilidad completa: corpus, pipeline, modelo, prompt, parámetros.

06
06Limitaciones y líneas futuras

Lo que este diseño no puede resolver

El diseño muestral no separa el efecto de la orientación del efecto del terapeuta o del cliente concretos — toda la evidencia sobre distribución de dominios es exploratoria, nunca confirmatoria.

  • 16 GB de memoria unificada condicionan qué modelos de gran escala pueden evaluarse con fiabilidad.
  • El corpus está en inglés: extiende el contexto académico e hispanohablante, no los datos.
  • En corpus de demostración, la orientación suele representarla un único profesional destacado — su estilo personal y el de la escuela son difíciles de separar.

Líneas futuras

  • Escalar a GPU institucionales o nube dentro del EEE, bajo contrato de encargado de tratamiento.
  • Ampliar el corpus para ajuste fino, e incorporar prosodia para rupturas de alianza.
  • Herramientas de supervisión clínica con paneles longitudinales, con las mismas garantías de confidencialidad.
07
07Plan de trabajo

Tres años, siete fases

Las fases 3 y 4 requieren solapamiento: la fiabilidad humana condiciona el nivel de detalle automatizado. Cronograma orientativo, sujeto al calendario de matriculación.

Fase
Año 1·S1
Año 1·S2
Año 2·S1
Año 2·S2
Año 3
F0Marco teórico y objetivos
F1Selección del corpus
F2Pipeline de desidentificación
F3Codificación humana
F4Codificación automatizada
F5Análisis comparativo
F6Redacción final y defensa

Fase 0 en curso. Las barras heredan el color de codificación humana (F3) y automatizada (F4) del apartado 5.4.

Plan de publicaciones (tentativo). No es tesis por compendio, pero se buscará que los resultados alimenten artículos científicos — número, alcance y canales a concretar con la dirección de tesis.
08
08Bibliografía

Todas las referencias citadas

El detalle completo, con formato APA, también está en el documento del plan de investigación.

Ver las referencias completas65 entradas, orden alfabético
+

Anderson, H., y Goolishian, H. (1988). Human systems as linguistic systems. Family Process, 27(4), 371-393.

Baker, A. Z., Peluso, P. R., Freund, R., Diaz, P., y Ghaness, A. (2022). Using dynamical systems mathematical modeling to examine emotional expression. Psychotherapy Research, 32(2), 223-237.

Bakhtin, M. (1986). The problem of speech genres. En Speech genres and other late essays (pp. 60-102). University of Texas Press.

Baldo et al. (2026). Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy. arXiv:2608.21325.

Berzonsky, M. D. (1992, junio). Self-construction and hard-core epistemic assumptions [Trabajo presentado]. Sixth Conference EAPP, Groningen.

Botella, L. (2001). Diálogo, relaciones y cambio. FPCEE Blanquerna, Universidad Ramón Llull.

Botella, L. (2020). La construcción del cambio terapéutico. Desclée De Brouwer.

Botella, L. (2025). Therapy Process Navigator (TPN) [Manuscrito en preparación].

Botella, L., Herrero, O., Pacheco, M., y Corbella, S. (2004). Relational constructivism. En Working with narrative in psychotherapy (pp. 119-136). FPCEE Blanquerna.

Botella, L., y Gallifa, J. (1995). A constructivist approach to personal epistemic assumptions. Journal of Constructivist Psychology, 8(1), 1-18.

Botella, L., y Herrero, O. (2000). A relational constructivist approach to narrative therapy. European Journal of Psychotherapy, Counselling and Health, 3(3), 407-418.

Botella, L., y Saúl, L. Á. (2026). Inteligencia artificial generativa en psicoterapia constructivista. Revista de Psicoterapia, 37(134), 46-54.

Can, D., Marín, R. A., Georgiou, P. G., Imel, Z. E., Atkins, D. C., y Narayanan, S. S. (2016). 'It sounds like...'. Journal of Counseling Psychology, 63(3), 343.

Carcone, A. I., Hasan, M., Alexander, G. L., et al. (2019). Developing machine learning models for behavioral coding. Journal of Pediatric Psychology, 44(3), 289-299.

Carkhuff, R. R. (1969). Helping and human relations (Vols. 1-2). Holt, Rinehart & Winston.

Carkhuff, R. R., y Anthony, W. A. (1979). The skills of helping. Human Resource Development Press.

Diaz, P., Peluso, P. R., Freund, R., Baker, A. Z., y Peña, G. (2023). Understanding the role of emotion and expertise in psychotherapy. Frontiers in Psychiatry, 14, 980739.

Ecker, B., y Hulley, L. (2000). Symptom coherence in depth-oriented brief therapy. En Constructions of disorder (pp. 63-89). APA.

Falkenström, F., Finkel, S., Sandell, R., Rubel, J. A., y Holmqvist, R. (2017). Dynamic models of individual change. Journal of Consulting and Clinical Psychology, 85(6), 537.

Feixas, G. (1991). Del individuo al sistema. Revista de Psicoterapia, 2, 91-120.

Gendlin, E. T. (1962). Experiencing and the creation of meaning.

Gergen, K. J. (1994). Realities and relationships. Harvard University Press.

Gibson, J., Can, D., Xiao, B., et al. (2016). A deep learning approach to modeling empathy in addiction counseling. Commitment, 111, 21.

Goodman, G., y Dooley, D. A. (1976). A framework for help-intended communication. Psychotherapy: Theory, Research, and Practice, 13(2), 106-117.

Hammerfald, K., Schmidt, F., Vlassov, V., Jahren, H. H., y Solbakken, O. A. (2025). Leveraging LLMs to identify microcounseling skills. Psychotherapy Research, 36(6), 1058-1076.

Hill, C. E. (1978). Development of a counselor verbal response category system. Journal of Counseling Psychology, 25(5), 461-468.

Hill, C. E. (2020). Helping Skills: Facilitating Exploration, Insight, and Action (5.ª ed.). APA.

Hill, C. E., y O'Brien, K. M. (1999). Helping skills. APA.

Hill, C. E., Thames, T. B., y Rardin, D. K. (1979). Comparison of Rogers, Perls, and Ellis on the Hill Counselor Verbal Response Category System. Journal of Counseling Psychology, 26(3), 198-203.

Imel, Z. E., Steyvers, M., y Atkins, D. C. (2015). Computational psychotherapy research. Psychotherapy, 52(1), 19.

Kelly, G. A. (1955/1991). The psychology of personal constructs. Routledge.

Luborsky, L., Singer, B., y Luborsky, L. (1975). Comparative studies of psychotherapies. Archives of General Psychiatry, 32(8), 995-1008.

Mahoney, M. J. (1991). Human change processes. Basic Books.

Mahrer, A. R. (1983). Taxonomy of procedures and operations in psychotherapy.

Mitchell, S. A. (1988). Relational concepts in psychoanalysis. Harvard University Press.

Mook, B. (1992). Intersubjetividad y estructura narrativa en la terapia familiar. Revista de Psicoterapia, 10-11, 13-22.

Neimeyer, R. A. (2008). Therapy begins with who we are, and extends to what we do.

Neimeyer, R. A., Herrero, O., y Botella, L. (2006). Self-narratives and interpersonal accounts of experience. En Working with narrative in psychotherapy. FPCEE Blanquerna.

Orlinsky, D. E., Rønnestad, M. H., y Willutzki, U. (2004). Fifty years of psychotherapy process-outcome research. En Bergin and Garfield's handbook (5.ª ed., pp. 307-389). Wiley.

Porter, E. H. (1943). The development and evaluation of a measure of counseling interview procedures. Educational and Psychological Measurement.

Raskin, J. D., y Lewandowski, A. M. (2000). The construction of disorder as human enterprise. En Constructions of disorder (pp. 15-40). APA.

Reglamento (UE) 2016/679 (RGPD), arts. 5, 9 y 25.

Rogers, C. R. (1957). The necessary and sufficient conditions of therapeutic personality change. Journal of Consulting Psychology, 21(2), 95-103.

Russell, R. L., y Stiles, W. B. (1979). Categories for classifying language in psychotherapy. Psychological Bulletin, 86(2), 404-419.

Safran, J. D., y Segal, Z. V. (1990). Interpersonal process in cognitive therapy. Basic Books.

Shostrum, E. L. (Productor). (1966). Three approaches to psychotherapy [Película]. Psychological Films.

Smith, M. L., y Glass, G. V. (1977). Meta-analysis of psychotherapy outcome studies. American Psychologist, 32(9), 752-760.

Stiles, W. B. (1979). Verbal response modes and psychotherapeutic technique. Psychiatry, 42(3), 201-215.

U.S. Department of Health and Human Services. (s.f.). De-identification guidance, HIPAA Privacy Rule (45 C.F.R. § 164.514). HHS.gov.

Wampold, B. E. (2001). The great psychotherapy debate. Lawrence Erlbaum Associates.

Wampold, B. E. (2015). How important are the common factors in psychotherapy? World Psychiatry, 14(3), 270-277.

Wampold, B. E., y Brown, G. S. (2005). Estimating variability in outcomes attributable to therapists. Journal of Consulting and Clinical Psychology, 73(5), 914-923.

Wampold, B. E., y Imel, Z. E. (2015). The great psychotherapy debate (2.ª ed.). Routledge.

Wampold, B. E., y Owen, J. (2021). Therapist effects. En Bergin and Garfield's handbook (pp. 301-330). Wiley.

Wittgenstein, L. (1953). Philosophical investigations. Macmillan.

Yim, B., Muran, J. C., Ren, Q., y Gorman, B. (2026). Exploring the application of LLMs in coding the experiencing scale (EXP). Cogent Mental Health, 5(1), 2664163.