Laboratorio 1 · Cátedra Acha · Departamento de Física, FCEyN, UBA
Bloque II · Modelos y ajustesRespuesta corta y desarrollo completo de las preguntas de la simulación.
Cada pregunta viene con una respuesta corta y con el desarrollo completo. Están plegadas a propósito: intentá contestarla vos primero — con la simulación abierta al lado, moviendo los deslizadores — y recién después abrí el desplegable. Leer la respuesta sin haber intentado no deja nada.
↩ Volver a la simulación · Todas las respuestas
S(a,b) = Σ(yi − a − b xi)² es una función cuadrática y convexa de (a,b); su hessiano es definido positivo mientras haya al menos dos x distintos. Las condiciones ∂S/∂a = ∂S/∂b = 0 dan un sistema lineal 2×2 con solución única. No aparecen otros mínimos locales ni ambigüedad en la solución: por eso el ajuste lineal es tan confiable comparado con el no lineal, donde sí puede haber varios mínimos y el resultado depende de los valores iniciales.
Lo que sí puede pasar — y es lo que la simulación quiere que veas — es que la recta de cuadrados mínimos no sea la mejor descripción física, porque S no siempre es el criterio correcto: si las barras son desiguales hay que minimizar χ² = Σ(ri/σi)²; si hay un outlier, S es extremadamente sensible (los residuos entran al cuadrado); y si el modelo está mal, minimizar correctamente no compensa la elección de un modelo inadecuado. Ajustar bien y modelar bien son problemas distintos.
R² compara la varianza explicada con la total. Si el término que falta aporta poco a la varianza total pero lo hace de manera sistemática, R² apenas se mueve mientras el modelo está claramente mal. Un R² de 0.997 puede parecer concluyente y, aun así, coexistir con un modelo que los residuos permiten cuestionar.
Los tres diagnósticos que sí funcionan, en orden de uso:
Referencia útil: Spiess & Neumeyer, BMC Pharmacology 10:6 (2010) muestran con simulaciones que R² es incapaz de discriminar entre modelos en contextos no lineales, y recomiendan explícitamente no usarlo como criterio de selección.
La pendiente es b = Σ(xi − x̄)(yi − ȳ) / Σ(xi − x̄)². En Anscombe IV hay diez puntos con x = 8 y uno con x = 19, de modo que x̄ = 9. Cada uno de los diez aporta (8 − 9)² = 1 al denominador, total 10; el punto aislado aporta (19 − 9)² = 100. El 91 % del peso lo tiene un único dato: si es un error de tipeo, todo el resultado queda condicionado por ese posible error de tipeo.
Esto se cuantifica con el leverage hii de la matriz sombrero: un valor cercano a 1 significa que el ajuste está obligado a pasar por ese punto, y por lo tanto su residuo es artificialmente pequeño — el diagnóstico de residuos tampoco necesariamente lo identifica. Detección práctica sin álgebra: sacar cada punto y ver cuánto cambia el resultado.
La consecuencia experimental es directa: Conviene evitar que la extensión del rango dependa de un único punto lejano. Si por razones prácticas hay un punto extremo que domina, repetilo varias veces y verificá que es reproducible. Además, mirá el gráfico: los cuatro conjuntos de Anscombe comparten media, varianza, pendiente, ordenada y R² hasta el segundo decimal, y no se parecen en nada.