thalmle v0.0.2: experimental T-HAL-MLE con evidencia verificada
En una frase: Un paquete R que implementa un método estadístico avanzado (T-HAL-MLE) para estimar cómo una dosis de tratamiento afecta un resultado, con código abierto, licencia AGPL-3.0-or-later y resultados experimentales documentados.
¿Qué es T-HAL-MLE y por qué importa?
Imagina que quieres saber cuánto mejora la salud de una persona al aumentar la dosis de un medicamento. El método Targeted Highly Adaptive Lasso Minimum Loss Estimation (T-HAL-MLE) usa aprendizaje automático para ajustar el modelo directamente al efecto que buscas, en lugar de modelar todo el sistema primero y luego derivar la respuesta. Es más preciso que los enfoques tradicionales cuando los datos son complejos.
Este repositorio (amurlaniakea/thalmle) es la primera implementación publicada en R, construida directamente desde el preprint científico (arXiv:2607.03824v1, 2026). No es un producto comercial: es investigación experimental con limitaciones claras.
Qué hace y qué no hace
-
Hace: Estima la curva dosis-respuesta
E[Y | A = a, W]para dosis continua, con regresión HAL (hal9001), densidad condicional (haldensify) y un paso de targeting conglmnet. -
No hace: Intervalos de confianza, varianza por influencia, ni validación exhaustiva (solo DGP 1 y 2 con
n = 500). El código es experimental. -
Evidencia: Los resultados experimentales (uniforme vs normal, con y sin modificación
w_cap) están documentados en el README con tablas de RMSE, no con afirmaciones sin respaldo.
Estado de gobernanza
El proyecto sigue un flujo de verificación profesional: implementación → auditoría independiente (clone limpio) → corrección de bugs y verificación de evidencia → publicación. El repositorio es público (master) con licencia AGPL-3.0-or-later, tag v0.0.2 y commit verificado (343ff8b). No hay banners internos ni URLs no verificables expuestas.
Para el público general ¿Qué demonios hace este repositorio?
Si no trabajas con estadística avanzada: piensa en este repo como un taller abierto donde se construye una herramienta de medición precisa, paso a paso, con notas de lo que funciona y lo que aún no. Todo está a la vista: el código, los datos experimentales (.rds y .log), las diferencias con el paper original y las limitaciones. Es ciencia reproducible, no marketing.
¿Qué demonios hace este repositorio? ! x)...
Este repositorio intenta construir y poner a prueba una herramienta estadística para estimar cómo cambia un resultado cuando cambia una variable de interés.
Por ejemplo, imaginemos que queremos saber qué ocurre con un resultado cuando una persona recibe diferentes cantidades de un tratamiento. En lugar de estudiar únicamente un valor concreto, la idea es poder estimar toda la relación entre la cantidad aplicada y el resultado esperado.
El método que se implementa aquí se llama T-HAL-MLE. Es un procedimiento estadístico relativamente sofisticado que combina modelos flexibles, selección de variables y técnicas diseñadas para que la estimación final se concentre en la pregunta que realmente nos interesa.
Este repositorio es una implementación experimental e independiente del método descrito en el paper. Su propósito no es presentar una caja negra ni afirmar que el método funciona simplemente porque el código produce resultados. Por eso, el repositorio incluye el código, las simulaciones, los resultados obtenidos y los registros de las ejecuciones.
También se documentan las diferencias encontradas respecto al paper original y los casos en los que nuestros resultados todavía no coinciden exactamente con los publicados.
En otras palabras: aquí se puede ver cómo se intenta reconstruir el método, cómo se comprueba su comportamiento y qué cosas todavía quedan por aclarar.
No es una demostración de que el método sea correcto ni una reproducción definitiva del paper. Es un proyecto de investigación reproducible en el que tanto los resultados positivos como los problemas encontrados forman parte de la evidencia.
Para entenderlo mejor:
¿Cuál es el objetivo del paper original?
El artículo científico original Targeted Highly Adaptive Lasso Minimum Loss Estimation nació para resolver un problema crítico en la ciencia de datos moderna: cómo extraer conclusiones exactas y fiables a partir de datos masivos y complejos sin hacer suposiciones a ciegas.
En la investigación tradicional, al analizar escenarios complejos (como el impacto exacto de la dosis de un medicamento), los científicos suelen verse obligados a "asumir" o simplificar la forma en que los datos se comportan mediante fórmulas matemáticas rígidas. Si esa suposición inicial es incorrecta, los resultados finales están sesgados.
Lo que los investigadores buscan lograr es un método completamente adaptable a los datos reales. Al fusionar un algoritmo de filtrado estricto (LASSO) con un sistema de optimización dirigida (TMLE), su objetivo es crear un "auditor matemático" automático. Este sistema elimina el ruido innecesario del modelo y garantiza que las mediciones, intervalos y conclusiones finales tengan un rigor estadístico absoluto y libre de sesgos, demostrando con matemáticas puras qué funciona y qué no.
Hoy en día, muchas IA generan respuestas basadas en "intuición" o probabilidad, lo que a veces provoca errores o inventos (alucinaciones). Este proyecto construye una herramienta que analiza los datos a fondo, filtra lo innecesario y verifica matemáticamente que la información sea exacta y confiable.
Sobre las fuentes originales de la investigación:
Sobre programa/repo en github:
Licencia: AGPL-3.0-or-later | Autor: Pedro Sordo Martínez | Repo: https://github.com/amurlaniakea/thalmle
Top comments (2)
Love the "evidence over claims" framing 😃listing exactly what v0.0.2 doesn't do (no CIs, no influence-curve variance, only 2 DGPs at n=500) is refreshing. The implement → audit → fix → publish loop is a solid pattern more projects should follow.
Curious: is influence-curve-based inference on the roadmap for v0.0.3? And any plans to benchmark against tmle3/hal9001 on larger n? Happy to run it on a test dataset and share results. 🙌
Gracias Sneha por comentar, gracias. Sí, hay plan para probar 1000 replicas de simulación.
Qué queda pendiente
...1000 replicas es muy tardado, lleva bastante tiempo hacer eso, pero se va a hacer.
Gracias Sneha. :)