Me llamó mucho la atención que subrayes de paso las técnicas de regularización como el "dropout" (abandono). Personalmente, he visto demasiados proyectos de desarrollo fracasar por subestimar sistemáticamente el sobreajuste. Al notar que el sistema en entrenamiento tiene una exactitud del 99% el equipo celebra prematuramente, pero cuando lo pones a rodar en producción —con imágenes borrosas o documentos judiciales escaneados y torcidos— el modelo colapsa de forma estrepitosa porque simplemente aprendió el "ruido" caprichoso de los datos originales, no el patrón general que necesitamos (Galea y Capelo, 2018).
Como bien documentaste, la regularización es entonces una contramedida indispensable; es forzar a la red a no depender perezosamente de ningún nodo en específico, lo cual paradójicamente aumenta su capacidad orgánica para generalizar. Esto se enlaza de forma asombrosa con el Transfer Learning que también mencionaste. Siempre repito que en el mundo real rara vez hay datos puros que nos permitan darnos el lujo de ignorar estas técnicas protectoras.
Galea, A., & Capelo, L. (2018). Applied Deep Learning with Python: Use Scikit-Learn, TensorFlow, and Keras to Create Intelligent Systems and Machine Learning Solutions. Packt Publishing.