DEV Community

Cover image for thalmle v0.0.2: experimental T-HAL-MLE con evidencia verificada
Fenix
Fenix

Posted on

thalmle v0.0.2: experimental T-HAL-MLE con evidencia verificada

thalmle v0.0.2: experimental T-HAL-MLE con evidencia verificada

En una frase: Un paquete R que implementa un método estadístico avanzado (T-HAL-MLE) para estimar cómo una dosis de tratamiento afecta un resultado, con código abierto, licencia AGPL-3.0-or-later y resultados experimentales documentados.

¿Qué es T-HAL-MLE y por qué importa?

Imagina que quieres saber cuánto mejora la salud de una persona al aumentar la dosis de un medicamento. El método Targeted Highly Adaptive Lasso Minimum Loss Estimation (T-HAL-MLE) usa aprendizaje automático para ajustar el modelo directamente al efecto que buscas, en lugar de modelar todo el sistema primero y luego derivar la respuesta. Es más preciso que los enfoques tradicionales cuando los datos son complejos.

Este repositorio (amurlaniakea/thalmle) es la primera implementación publicada en R, construida directamente desde el preprint científico (arXiv:2607.03824v1, 2026). No es un producto comercial: es investigación experimental con limitaciones claras.

Qué hace y qué no hace

  • Hace: Estima la curva dosis-respuesta E[Y | A = a, W] para dosis continua, con regresión HAL (hal9001), densidad condicional (haldensify) y un paso de targeting con glmnet.
  • No hace: Intervalos de confianza, varianza por influencia, ni validación exhaustiva (solo DGP 1 y 2 con n = 500). El código es experimental.
  • Evidencia: Los resultados experimentales (uniforme vs normal, con y sin modificación w_cap) están documentados en el README con tablas de RMSE, no con afirmaciones sin respaldo.

Estado de gobernanza

El proyecto sigue un flujo de verificación profesional: implementación → auditoría independiente (clone limpio) → corrección de bugs y verificación de evidencia → publicación. El repositorio es público (master) con licencia AGPL-3.0-or-later, tag v0.0.2 y commit verificado (343ff8b). No hay banners internos ni URLs no verificables expuestas.

Para el público general ¿Qué demonios hace este repositorio?

Si no trabajas con estadística avanzada: piensa en este repo como un taller abierto donde se construye una herramienta de medición precisa, paso a paso, con notas de lo que funciona y lo que aún no. Todo está a la vista: el código, los datos experimentales (.rds y .log), las diferencias con el paper original y las limitaciones. Es ciencia reproducible, no marketing.

¿Qué demonios hace este repositorio? ! x)...

Este repositorio intenta construir y poner a prueba una herramienta estadística para estimar cómo cambia un resultado cuando cambia una variable de interés.

Por ejemplo, imaginemos que queremos saber qué ocurre con un resultado cuando una persona recibe diferentes cantidades de un tratamiento. En lugar de estudiar únicamente un valor concreto, la idea es poder estimar toda la relación entre la cantidad aplicada y el resultado esperado.

El método que se implementa aquí se llama T-HAL-MLE. Es un procedimiento estadístico relativamente sofisticado que combina modelos flexibles, selección de variables y técnicas diseñadas para que la estimación final se concentre en la pregunta que realmente nos interesa.

Este repositorio es una implementación experimental e independiente del método descrito en el paper. Su propósito no es presentar una caja negra ni afirmar que el método funciona simplemente porque el código produce resultados. Por eso, el repositorio incluye el código, las simulaciones, los resultados obtenidos y los registros de las ejecuciones.

También se documentan las diferencias encontradas respecto al paper original y los casos en los que nuestros resultados todavía no coinciden exactamente con los publicados.

En otras palabras: aquí se puede ver cómo se intenta reconstruir el método, cómo se comprueba su comportamiento y qué cosas todavía quedan por aclarar.

No es una demostración de que el método sea correcto ni una reproducción definitiva del paper. Es un proyecto de investigación reproducible en el que tanto los resultados positivos como los problemas encontrados forman parte de la evidencia.

Para entenderlo mejor:

¿Cuál es el objetivo del paper original?

El artículo científico original Targeted Highly Adaptive Lasso Minimum Loss Estimation nació para resolver un problema crítico en la ciencia de datos moderna: cómo extraer conclusiones exactas y fiables a partir de datos masivos y complejos sin hacer suposiciones a ciegas.

En la investigación tradicional, al analizar escenarios complejos (como el impacto exacto de la dosis de un medicamento), los científicos suelen verse obligados a "asumir" o simplificar la forma en que los datos se comportan mediante fórmulas matemáticas rígidas. Si esa suposición inicial es incorrecta, los resultados finales están sesgados.

Lo que los investigadores buscan lograr es un método completamente adaptable a los datos reales. Al fusionar un algoritmo de filtrado estricto (LASSO) con un sistema de optimización dirigida (TMLE), su objetivo es crear un "auditor matemático" automático. Este sistema elimina el ruido innecesario del modelo y garantiza que las mediciones, intervalos y conclusiones finales tengan un rigor estadístico absoluto y libre de sesgos, demostrando con matemáticas puras qué funciona y qué no.

Hoy en día, muchas IA generan respuestas basadas en "intuición" o probabilidad, lo que a veces provoca errores o inventos (alucinaciones). Este proyecto construye una herramienta que analiza los datos a fondo, filtra lo innecesario y verifica matemáticamente que la información sea exacta y confiable.



Sobre las fuentes originales de la investigación:

[2607.03824] Targeted Highly Adaptive Lasso Minimum Loss Estimation of Target Functions

We propose a Targeted Highly Adaptive Lasso for estimation of non-pathwise differentiable functional parameters such as the dose-response curve (DRC) for continuous exposure. We assume the target function lies in the $k$-th order smoothness class used to define the $k$-th order Highly Adaptive Lasso (HAL), which can be well approximated by linear spans of $k$-th order spline basis functions. We construct a projection of the true target function onto a large finite dimensional working model spanned by an initial set of $k$-th order spline basis functions, which defines a pathwise differentiable approximation of the target functional parameter. A standard TMLE is then applied with a data-adaptive initial fit, replacing the MLE targeting step with a LASSO step over HAL spline basis functions that span the target function. We prove that the resulting Targeted HAL-MLE is pointwise asymptotically normally distributed and achieves a convergence rate determined solely by the dimension and smoothness of the target function, giving dimension free rates up till $\log n$-factors. Through a simulation study for the DRC, we show that the Targeted HAL outperforms a HAL plug-in estimator in terms of bias and mean squared error. Targeted HAL offers a fully data-adaptive approach to inference on functional parameters without requiring sieve specification or parametric assumptions.

favicon arxiv.org


Sobre programa/repo en github:

Licencia: AGPL-3.0-or-later | Autor: Pedro Sordo Martínez | Repo: https://github.com/amurlaniakea/thalmle

Top comments (2)

Collapse
 
thesnehamk profile image
Sneha M K •

Love the "evidence over claims" framing 😃listing exactly what v0.0.2 doesn't do (no CIs, no influence-curve variance, only 2 DGPs at n=500) is refreshing. The implement → audit → fix → publish loop is a solid pattern more projects should follow.

Curious: is influence-curve-based inference on the roadmap for v0.0.3? And any plans to benchmark against tmle3/hal9001 on larger n? Happy to run it on a test dataset and share results. 🙌

Collapse
 
magopredator profile image
Fenix • • Edited

Gracias Sneha por comentar, gracias. Sí, hay plan para probar 1000 replicas de simulación.

Qué queda pendiente

  • exact paper-specific HAL hyperparameters;
  • full 1,000-replicate simulation;
  • complete DGP1–DGP3 comparison;
  • systematic comparison of the (\Sigma^{-1}) implementation;
  • exact comparison against the authors' implementation, if it becomes available.

...1000 replicas es muy tardado, lleva bastante tiempo hacer eso, pero se va a hacer.

Gracias Sneha. :)