Forma Descripción generada automáticamente
Forma Descripción generada automáticamente
Revista Multidisciplinar Epistemología de las Ciencias
Volumen 3, Número 3, 2026, julio-septiembre, Edición Especial
DOI: https://doi.org/10.71112/fdzkm898
LEVENBERG-MARQUARDT: UN ENFOQUE HÍBRIDO PARA LA MEJORA DEL
RENDIMIENTO EN REDES NEURONALES
LEVENBERG-MARQUARDT: A HYBRID APPROACH FOR IMPROVING
PERFORMANCE IN NEURAL NETWORKS
Ernesto Antonio Morales Rodríguez
El Salvador
DOI: https://doi.org/10.71112/fdzkm898
88 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Levenberg-Marquardt: Un enfoque híbrido para la mejora del rendimiento en
redes neuronales
Levenberg-Marquardt: A hybrid approach for improving performance in neural
networks
Ernesto Antonio Morales Rodríguez
a,*
ernesto.morales@usonsonate.edu.sv
https://orcid.org/0009-0004-1934-7204
*Autor de correspondencia: ernesto.morales@usonsonate.edu.sv,
a
Universidad de Sonsonate,
El Salvador
RESUMEN
El presente trabajo analiza la aplicación del algoritmo de LevenbergMarquardt (LM) como
método de optimización para el entrenamiento de redes neuronales multicapa. Este enfoque
combina la rapidez del método de GaussNewton con la estabilidad del gradiente descendente,
ajustando dinámicamente un parámetro de amortiguamiento que regula su comportamiento. Se
desarrolló un marco teórico que explica su formulación matemática a partir de la expansión de
Taylor, el cálculo del gradiente y el Jacobiano, y su adaptación al aprendizaje supervisado. Los
resultados experimentales demuestran que LM mejora significativamente la velocidad de
convergencia y la precisión del modelo respecto a métodos de primer orden, logrando un error
cuadrático medio notablemente menor. Esto confirma su efectividad para optimizar funciones
altamente no lineales y complejas en redes neuronales.
Palabras clave: LevenbergMarquardt; Redes Neuronales; Optimización; Convergencia;
Aprendizaje Supervisado.
DOI: https://doi.org/10.71112/fdzkm898
89 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
ABSTRACT
This work analyzes the application of the LevenbergMarquardt (LM) algorithm as an
optimization method for training multilayer neural networks. This approach combines the speed
of the GaussNewton method with the stability of gradient descent, dynamically adjusting a
damping parameter that regulates its behavior. A theoretical framework was developed to
explain its mathematical formulation based on the Taylor expansion, the computation of the
gradient and the Jacobian, and its adaptation to supervised learning. Experimental results show
that LM significantly improves both the convergence speed and the accuracy of the model
compared to first-order methods, achieving a noticeably lower mean squared error. This
confirms its effectiveness in optimizing highly nonlinear and complex functions in neural
networks.
Keywords: LevenbergMarquardt; Neural Networks; Optimization; Convergence; Supervised
Learning
Recibido: 16 febrero 2026 | Aceptado: 30 junio 2026 | Publicado1 julio 2026
INTRODUCCIÓN
El entrenamiento eficiente de redes neuronales artificiales constituye un aspecto
fundamental en el ámbito del aprendizaje automático, especialmente en problemas que
involucran funciones de error altamente no lineales y espacios de parámetros de gran
complejidad. Los métodos tradicionales de optimización, como el descenso por gradiente,
presentan limitaciones inherentes relacionadas con la lentitud en la convergencia, la
sensibilidad a la tasa de aprendizaje y la propensión a quedar atrapados en mínimos locales, lo
que puede comprometer la estabilidad del proceso de aprendizaje (A. Ranganath, 2024).
DOI: https://doi.org/10.71112/fdzkm898
90 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Ante estas limitaciones, el algoritmo de LevenbergMarquardt (LM) se ha consolidado
como una alternativa eficiente para la optimización de redes neuronales multicapa. Este
método combina la rapidez del algoritmo de GaussNewton con la estabilidad del gradiente
descendente, introduciendo un parámetro de amortiguamiento λ que se ajusta dinámicamente
durante el proceso de entrenamiento. Dicho parámetro permite controlar el tamaño del paso de
actualización, logrando un equilibrio entre la exploración del espacio de soluciones y la
estabilidad numérica del procedimiento (Adhirai Subramaniyam, 2019).
El enfoque de LevenbergMarquardt puede considerarse una aproximación de
segundo orden al minimizar el error cuadrático medio, sin requerir el cálculo explícito del
Hessiano. Gracias a esta característica, el algoritmo presenta una convergencia más rápida y
precisa en comparación con los métodos de primer orden, lo que lo hace especialmente
adecuado para problemas de regresión no lineal, predicción y clasificación (Adrien B. Taylor J.
H., 2015).
METODOLOGÍA
El algoritmo de Levenberg-Marquardt es una variación del método de Newton, que fue
diseñado para minimizar funciones que son sumas de cuadrados de otras funciones no
lineales. Esto resulta muy adecuado para el entrenamiento de redes neuronales donde el índice
de rendimiento que es el error cuadrático medio. Este texto se centra en demostrar como el
algoritmo fusiona lo mejor de los algoritmos (Newton y Gradiente Descendente) más eficientes
para solución numérica, integrándolo en el entrenamiento de redes neuronales paramétricas
multicapa (Adrien B. Taylor Y. D., 2021).
Ahora bien, para comprender el algoritmo hay que sentar las bases para descifrarlo.
Para ello nos centraremos en las superficies de rendimiento y puntos óptimos y optimización
DOI: https://doi.org/10.71112/fdzkm898
91 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
del rendimiento, tomando en cuenta algoritmos de solución numérica y series de potencias
(Alexandru Damian, 2022).
Superficie de rendimiento y punto optimo
Aprendizaje y rendimiento
Existen varias leyes de aprendizaje diferentes que se incluyen en la categoría de
aprendizaje por rendimiento o desempeño. Estas leyes de aprendizaje se distinguen por el
hecho de que durante el entrenamiento los parámetros de la red (pesos y bias o sesgos) se
ajustan en un esfuerzo para optimizar el rendimiento de la red (Antoine Lesage-Landry, 2020).
Índice de rendimiento
Hay dos pasos involucrados en este proceso de optimización. El primero es definir que
entendemos por rendimiento. En otras palabras, debemos encontrar una medida cuantitativa
del desempeño de la red, llamada índice de rendimiento, que es pequeño cuando la red
funciona bien y grande cuando la red funciona mal (Aryan Mokhtari, 2017).
El segundo paso del proceso de optimización es de buscar el espacio de parámetros
(ajustar los pesos y sesgos de la red) para reducir índice de rendimiento (Mou Wu, 2020).
Serie de Taylor
Supongamos que el índice de rendimiento que se quiere minimizar está representado
por
()Fx
, donde
x
es el parámetro escalar que estamos ajustando. Supondremos que el
índice de rendimiento es una función analítica (P. Baldi, 2016). Entonces puede representarse
mediante su desarrollo en la expansión de la serie de Taylor sobre algún punto nominal
cualquiera
x
:
DOI: https://doi.org/10.71112/fdzkm898
92 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
2
2
2
( ) ( ) ( ) ( )
1
+ ( ) ( ) ...
2
1
+ ( ) ( ) ...
!
xx
xx
n
n
n
xx
d
F x F x F x x x
dx
d
F x x x
dx
d
F x x x
n dx

=
=
=
= +
−+
−+
(1)
Caso vectorial.
Por supuesto, el índice de rendimiento de la red neuronal no será una función de un escalar
x
.
Será función de todos los parámetros de la red (pesos y bias), de los cuales puede haber un
número muy grande. Por lo tanto, necesitamos extender la expansión de Taylor a funciones de
muchas variables (C. Uriarte, 2024).
Consideremos la siguiente función de variables:
12
( ) ( , ,..., )
n
F x F x x x=
(2)
El desarrollo de la serie de Taylor para esta función, respecto al punto
x
, seria:
1 1 2 2
12
2
2
11
2
1
2
1 1 2 2
12
( ) ( ) ( ) ( ) ( ) ( )
1
... ( ) ( ) ( ) ( )
2
1
( ) ( )( ) ...
2
x x x x
nn
x x x x
n
xx
F x F x F x x x F x x x
xx
F x x x F x x x
xx
F x x x x x
xx


==

==

=

= + +


+ + +

+ +

(3)
Esta notación se nota engorrosa y compleja, pero es más conveniente escribirla de la
siguiente forma:
2
( ) ( ) ( ) ( )
1
( ) ( ) ( ) ...
2
T
xx
T
xx
F x F x F x x x
x x F x x x

=

=
= +
+ +
(4)
Donde
()Fx
es el gradiente, y se define como:
DOI: https://doi.org/10.71112/fdzkm898
93 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
12
( ) ( ) ( )... ( )
T
n
F x F x F x F x
x x x

=


(5)
Y
2
()Fx
es el Hessiano, y se define como:
2 2 2
2
1 1 2 1
2 2 2
2
2
2 1 2 2
2 2 2
2
12
( ) ( ) ... ( )
( ) ( ) ... ( )
()
( ) ( ) ... ( )
n
n
n n n
F x F x F x
x x x x x
F x F x F x
Fx
x x x x x
F x F x F x
x x x x x





=







(6)
El gradiente y el Hessiano son muy importantes para comprender las superficies de
rendimiento utilizando la derivada de dirección (Chunfu Guo, 2023).
Derivada direccional
El enésimo elemento del gradiente,
()
i
F x x
, es la primera derivada del índice de
rendimiento
F
a lo largo del eje
i
x
. El enésimo elemento de la diagonal
F
de la matriz
Hessiana,
22
()
i
F x x
, es la segunda derivada del índice de rendimiento
F
a lo largo del eje
i
x
. ¿Qué pasaría si necesitamos saber la derivada de la función en una dirección arbitraria?
Sea
P
un vector en la dirección en la que deseamos conocer la derivada (R. B. Yunus, 2024).
Esta derivada direccional puede ser calculada a partir de:
()
T
p F x
p
(7)
DOI: https://doi.org/10.71112/fdzkm898
94 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
La segunda derivada a lo largo de
P
también se puede calcular.
2
2
()
T
p F x p
p
(8)
Mínimos
Recordemos que el objetivo del aprendizaje del rendimiento será optimizar el índice de
rendimiento de la red. Definiremos que se entiende por punto óptimo. Supongamos que el
punto óptimo es un mínimo del índice de rendimiento. Las definiciones se pueden modificar
fácilmente para problemas de maximización (D. Rotondo, 2024).
Mínimo fuerte.
El punto
x
es un mínimo fuerte de
x
si un escalar
0
existe, tal que
( ) ( )F x F x x

+
para todo
x
tal que
0x
.
En otras palabras, si nos alejamos de un mínimo fuerte una pequeña distancia en
cualquier función, la función aumentara.
Mínimo global.
El punto
x
es un mínimo global único de
()Fx
si
( ) ( )F x F x x

+
para todo
0x
.
Para un mínimo fuerte simple,
x
, la función puede ser menor que
()Fx
en algunos
puntos fuera de un pequeño grupo de
x
. Por lo tanto, a esto a veces de le llama mínimo local.
Para un mínimo global, la función será mayor que el punto mínimo en cualquier otro punto del
espacio de parámetros (Damien Lee, 2023).
Mínimo débil.
El punto
x
es un mínimo débil de
()Fx
si no es un mínimo fuerte, y el escalar
0
existe, tal que
( ) ( )F x F x x

+
para todo
x
tal que
0x
.
DOI: https://doi.org/10.71112/fdzkm898
95 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
No importa en qué dirección nos alejemos del mínimo débil, la función no puede
disminuir, aunque puede haber algunas direcciones en las que no cambie (Dongsheng Guo,
2017).
Condiciones necesarias para la optimización
Habiendo definido lo que ahora entendemos por punto óptimo (mínimo), pasaremos a
identificar algunas condiciones que dicho punto debe de satisfacer (R. Dehghani, 2018).
Usando nuevamente la expansión de Taylor para derivar estas condiciones:
2
( ) ( ) ( ) ( )
1
( ) ...
2
T
xx
T
xx
F x F x x F x F x x
x F x x

=
=
= + = +
+ +
(9)
Donde
x x x
=
(10)
Condiciones de primer orden
Si
x
es muy pequeño, entonces los términos de orden superior en la ecuación (9)
será insignificante y podemos aproximar la función como:
( ) ( ) ( )
T
xx
F x x F x F x x

=
+ +
(11)
El punto
x
es un punto mínimo candidato, lo que significa que la función debe subir (o
al menos no bajar) si
x
no es cero. Para que esto suceda, el segundo término de la ecuación
(11) no debería ser negativo (Shuvomoy Das Gupta, 2023). En otras palabras:
( ) 0
T
xx
F x x
=
(12)
DOI: https://doi.org/10.71112/fdzkm898
96 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Sin embargo, si el termino es positivo,
( ) 0
T
xx
F x x
=
(13)
Entonces, esto implicaría que
( ) ( ) ( ) ( )
T
xx
F x x F x F x x F x
=
+
(14)
Pero esto es una contradicción, ya que
x
debería ser un punto mínimo. Por lo tanto,
la ecuación (12) debe ser cierta y la ecuación (13) debe ser falsa, la única alternativa debe ser
que:
( ) 0
T
xx
F x x
=
=
(15)
Como esto debe ser cierto para cualquier
x
, tenemos
( ) 0
xx
Fx
=
=
(16)
Por lo tanto, el gradiente debe ser cero en un punto mínimo. Esta es una condición de
primer orden, necesaria (pero no suficiente) para que
x
sea un mínimo local. Cualquier punto
que satisfaga la ecuación (16) se llaman puntos estacionarios (Gleich, 2017).
Condiciones de segundo orden
Supongamos que tenemos un punto estacionario
x
. Dado que el gradiente de
()Fx
es cero en todos los puntos estacionarios, la expansión de la serie de Taylor será
2
1
( ) ( ) ( ) ...
2
T
xx
F x x F x x F x x

=
+ = + +
(17)
DOI: https://doi.org/10.71112/fdzkm898
97 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Como antes se consideró solo aquellos puntos en un pequeño grupo de
x
, de modo
que
x
sea pequeño y
()Fx
pueda aproximarse mediante los dos primeros términos de la
ecuación (17). Por lo tanto, existirá un mínimo fuerte en
x
si
2
( ) 0
T
xx
x F x x
=
(18)
Funciones cuadráticas
Hay un tipo de índice de rendimiento que es universal: la función cuadrática. Esto es
cierto porque hay muchas aplicaciones en las que aparece la función cuadrática, pero también
porque muchas funciones pueden aproximarse por medio de estas funciones en grupos
pequeños, especialmente cerca de puntos mínimos locales (Hawraz N. Jabbar, 2021).
Usaremos la siguiente forma general de la función cuadrática:
1
()
2
TT
F x x Ax d x c= + +
(19)
Donde la matriz
A
es simétrica. (Si la matriz no es sitrica se puede reemplazar por
la matriz simétrica que produzca
()Fx
(Huanshui Zhang, 2024).
Para encontrar el gradiente de esta función, usaremos las siguientes propiedades
útiles del gradiente:
( ) ( )
TT
h x x h h = =
(20)
Donde
h
es un vector constante, y:
2
TT
x Qx Qx Q x Qx = + =
(21)
Ahora podemos calcular el gradiente de
()Fx
:
()F x Ax d = +
(22)
DOI: https://doi.org/10.71112/fdzkm898
98 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Y de manera similar podemos encontrar el Hessiano:
2
()F x A=
(23)
Optimización del rendimiento
Ya que se tiene comprendido como analizar una superficie de rendimiento para
determinar las condiciones que deben satisfacer los puntos óptimos, usaremos nuevamente la
expansión de la serie de Taylor, en este caso para desarrollar un algoritmo que localice los
puntos óptimos. Agregando a todo, cabe aclarar que cada algoritmo es iterativo (Ivan Perez
Avellaneda, 2023).
Para nuestro propósito, la palabra optimizar significara encontrar el valor de
x
que
minimice
()Fx
(Shuvomoy Das Gupta, 2023). Se parte de una suposición inicial,
0
x
, y luego
se actualiza esa suposición en etapas de acuerdo con una ecuación de la forma:
1k k k k
x x p
+
=+
(24)
o de la forma:
1
()
k k k k k
x x x p
+
= =
(25)
Donde el vector
k
p
representa una dirección de búsqueda, y el escalar positivo
k
es la taza de aprendizaje, que determina la longitud del paso o el desplazamiento (Jaehoon
Lee, 2019).
Gradiente descendente
Cuando se actualiza la estimación del punto óptimo (mínimo) usando la ecuación (24),
se quiere que la función disminuya en cada iteración. En otras palabras:
1
( ) ( )
kk
F x F x
+
(26)
DOI: https://doi.org/10.71112/fdzkm898
99 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Aquí se genera una interrogante ¿Cómo podemos elegir una dirección,
k
p
, de modo
que, para una tasa de aprendizaje,
k
, lo suficientemente pequeña, esta pueda ir en
descenso? Podemos considerar la expansión de la serie de Taylor de primer orden (ver
ecuación (4)) de
()Fx
sobre la suposición
k
x
:
1
( ) ( ) ( )
T
k k k k k k
F x F x x F x g x
+
= + +
(27)
Donde
k
g
es el gradiente evaluado en la suposición
k
x
:
()
k
k x x
g F x
=

(28)
Para que
1
()
k
Fx
+
sea menor que
()
k
Fx
, el segundo termino en el lado derecho de la
ecuación (27) debe ser negativo:
0
TT
k k k k k
g x g p
=
(29)
Ahora se selecciona un
k
que sea más pequeño, pero mayor que cero. Esto implica
que:
0
T
kk
gp
(30)
Dirección de descenso
Cualquier vector
k
p
que satisfaga la ecuación se llama dirección de descenso. La función
debe disminuir si damos un paso lo suficientemente pequeño en esa dirección. Esto nos lleva a
otra pregunta ¿Cuál es la dirección del descenso más pronunciado? (¿En qué dirección la
función disminuirá más rápidamente?).
Esto ocurrirá cuando
T
kk
gp
(31)
DOI: https://doi.org/10.71112/fdzkm898
100 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
es más negativo. (Se asume que la longitud de
k
p
no cambia, solo su dirección). Este
es un producto interno entre el gradiente y el vector de dirección. Será más negativo cuando el
vector de dirección sea el gradiente. Por lo tanto, un vector que apunta en la dirección de
descenso más pronunciada es
kk
Pg=−
(32)
Descenso más pronunciado (gradiente descendente)
Usando esto en la iteración de la ecuación (24) se produce el método del descenso más
pronunciado o descenso de gradiente:
1k k k k
x x p
+
=−
(33)
Tasa de aprendizaje.
Para el descenso de gradiente, existen dos métodos generales para determinar la tasa
de aprendizaje,
k
a
. Un enfoque es minimizar el índice de rendimiento
()Fx
con respecto a
k
a
en cada iteración. En este caso estamos minimizando a lo largo de una línea representada por:
k k k
xp
(34)
Método de Newton
La derivación del algoritmo del descenso de gradiente se basó en la expansión de la
serie de Taylor de primer orden. El metodo de Newton se basa en la serie de Taylor de
segundo orden (Taylor Simons, 2019):
1
1
( ) ( ) ( )
2
TT
k k k k k k k k k
F x F x x F x g x x A x
+
= + + +
(35)
El principio detrás de este método es localizar el punto estacionario de una
aproximación cuadrática de
()Fx
. Si utilizamos la ecuación (22) para tomar el gradiente de
esta función cuadrática con respecto a
k
x
e igualarlo a cero, obtenemos:
DOI: https://doi.org/10.71112/fdzkm898
101 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
0
k k k
g A x+ =
(36)
Resolviendo para
k
x
tenemos:
1
k k k
x A g
=
(37)
Entonces se define el método de Newton como:
1
1k k k k
x x A g
+
=−
(38)
RESULTADOS
Algoritmo Levenberg-Marquardt
Comencemos considerando la forma del método de Newton donde el índice de
rendimiento es una suma de cuadrados (Taylor Simons, 2019). Recordemos que el método de
Newton para optimizar el índice de rendimiento
()Fx
es (38) donde:
2
()
()
k
k
k x x
k x x
A F x
g F x
=
=


(39)
Si asumimos que
()Fx
es una función de suma de cuadrados:
2
1
( ) ( ) ( ) ( )
N
T
i
i
F x v x v x v x
=
==
(40)
Entonces, el jth (
j
ésimo) elemento del gradiente seria:
1
( ) ( )
( ) 2 ( )
N
i
i
j
i
jj
F x v x
F x v x
xx
=

=

(41)
Por lo tanto, el gradiente se puede expresar en forma matricial:
( ) 2 ( ) ( )
T
F x J x v x=
(42)
DOI: https://doi.org/10.71112/fdzkm898
102 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Donde:
1 1 1
12
2 2 2
12
12
( ) ( ) ( )
( ) ( ) ( )
()
( ) ( ) ( )
n
n
N N N
n
v x v x v x
x x x
v x v x v x
x x x
Jx
v x v x v x
x x x





=







(43)
La expresión anterior es la matriz Jacobiana.
A continuación, encontramos la matriz Hessiana. Los
,kj
elementos de la matriz
serian:
22
2
,
1
( ) ( ) ( ) ( )
( ) 2 ( )
N
i i i
i
kj
i
k j k j k j
F x v x v x v x
F x v x
x x x x x x
=



= = +




(44)
La matriz Hessiana de los elementos se puede expresar en su forma matricial:
2
( ) 2 ( ) ( ) 2 ( )
T
F x J x J x S x = +
(45)
Donde
2
1
( ) ( ) ( )
N
ii
i
S x v x v x
=
=
(46)
Si se asume que
()Sx
es pequeño, podemos aproximar la matriz Hessiana como:
2
( ) 2 ( ) ( ) 2 ( )
T
F x J x J x S x = +
(47)
Si luego se sustituye la ecuación (47) y la ecuación (42) en la ecuación (38),
obtendremos el método de Gauss-Newton:
1
1
1
2 ( ) ( ) 2 ( ) ( )
( ) ( ) ( ) ( )
TT
k k k k k k
TT
k k k k k
x x J x J x J x v x
x J x J x J x v x
+

=−


=−

(48)
DOI: https://doi.org/10.71112/fdzkm898
103 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
La gran ventaja del algoritmo de Gauss-Newton sobre el método estándar de Newton
es que no requiere el cálculo de segundas derivadas (Jamie M. Taylor, 2022).
Un problema con el método de Gauss-Newton es que la matriz
T
H J J=
puede no ser
invertida (Weilong Liao, 2022). Este problema se puede superar utilizando la siguiente
modificación de la matriz Hessiana aproximada:
G H I
=+
(49)
Para determinar cómo esta matriz puede hacerse invertible, podemos suponer que los
valores y vectores propios (eigenvalues & eigenvectors) de
H
son
12
, , ...,
n
y
12
, , ...,
n
z z z
(Yuan-Yuan Cheng, 2025). Se tiene:
( )
i i i i i i i i i
Gz H I z Hz z z z z
= + = + = + = +
(50)
Por lo tanto, los vectores propios de
G
son los mismos vectores propios de
H
, y los
valores propios de
G
son
( )
i

+
.
G
puede definirse como positivo aumentando
hasta
( )
0
i

+
para todos
i
, y de esa manera la matriz será invertible (Jesse Chan, 2020).
Esto nos lleva al algoritmo Levenberg-Marquardt:
1
1
( ) ( ) ( ) ( )
TT
k k k k k k k
x x J x J x I J x v x
+

= +

(51)
O:
1
( ) ( ) ( ) ( )
TT
k k k k k k
x J x J x I J x v x

= +

(52)
Este algoritmo tiene la característica muy útil de que, a medida que
k
se aumenta,
se acerca al algoritmo del gradiente descendente con una taza de aprendizaje muy pequeña:
( ) ( )
1
11
()
2
T
k k k k k
kk
x x J x v x x F x

+
=
(53)
DOI: https://doi.org/10.71112/fdzkm898
104 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Mientras que
k
se reduce a cero, el algoritmo de convierte en Gauss-Newton (Yunjin
Tong, 2020).
El algoritmo comienza con
k
estableciendo un valor pequeño (ejemplo,
0.01
k
=
).
Si un paso no produce un valor menor para
()Fx
, entonces el paso se repite con
k
multiplicado con algún factor
1
(ejemplo,
10
=
). Finalmente
()Fx
debería disminuir, ya
que estaríamos dando un paso en la dirección del gradiente descendente. Si un paso produce
un valor menor para
()Fx
, entonces
k
es dividido por
para el siguiente paso, de modo
que el algoritmo se acerque a Gauss-Newton, lo que debería proporcionar una convergencia
más rápida. El algoritmo proporciona un buen compromiso entre la velocidad del método de
Newton y la convergencia garantizada del gradiente descendente (John Taylor, 2022).
Ahora veamos cómo podemos aplicar el algoritmo al problema del entrenamiento de
redes multicapa. El índice de rendimiento para el entrenamiento de redes multicapa es el error
cuadrático medio. Si cada objetivo ocurre con la misma posibilidad, el error cuadrático medio es
proporcional a la suma de los errores cuadráticos de los objetivos
Q
en el conjunto de
entrenamiento:
( ) ( )
( )
( )
1
2
2
,
1 1 1 1
( ) t a t a
e e
M
Q
T
q q q q
q
QQ
SN
T
q q j q i
q q j i
Fx
ev
=
= = = =
=
= = =
(54)
Donde
,jq
e
es el
j
ésimo (
j
th) elemento del error para el
q
ésimo (
q
th) par
entrada/objetivo del entrenamiento.
S
el número de neuronas por capa,
a
es la salida o
resultado de la red,
M
el número de capas de la red (Marcus Carlsson, 2025).
La ecuación (54) es equivalente al índice de rendimiento, ecuación (40), para el cual
se diseñó el algoritmo Levenberg-Marquardt. Por lo tanto, debería ser sencillo adaptar el
DOI: https://doi.org/10.71112/fdzkm898
105 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
algoritmo para el entrenamiento de la red. Resulta que esto es cierto en concepto, pero
requiere cierto cuidado al resolver los detalles (Zheyuan Hu, 2023).
Comparación del Gradiente Descendente vs Levenberg-Marquardt
Caso 1. Función de Himmelblau
La Figura 1(a) y (b) ilustran la comparación entre los algoritmos de Descenso por
Gradiente (GD) y LevenbergMarquardt (LM) aplicados a la función de Himmelblau, una
superficie clásica de prueba en optimización no lineal definida por:
2
2 2 2 2
11
( , ) ( , ) ( 11) ( 7)
22
C x y r x y x y x y

= = + + +

(55)
Figura 1
Trayectorias con puntos arbitrarios con vistas en el plano superficial y tridimensional
a) b)
Los resultados demuestran que:
LM desciende la superficie de forma casi directa hacia los valles de mínimo,
aprovechando la información del Jacobiano para ajustar la dirección y magnitud del
paso.
GD, en cambio, desciende con movimientos más conservadores, perdiendo eficiencia
cuando la superficie presenta curvaturas pronunciadas o zonas planas.
DOI: https://doi.org/10.71112/fdzkm898
106 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Ambos métodos alcanzan los mismos puntos mínimos (los cuatro valles característicos
de Himmelblau), pero con un tiempo de convergencia radicalmente menor para LM (promedio
de 5.8 iteraciones frente a 110.8 para GD).
Esto evidencia la capacidad del algoritmo LM para adaptar su paso mediante el
parámetro de amortiguamiento λ, que le permite comportarse como GaussNewton cerca de la
solución (rápido) y como GD cuando está lejos del óptimo (seguro).
Tabla 1
Análisis numérico de GD vs LM
Inicio
Mínimo
alcanzado
Iteraciones GD
Iteraciones
LM
Relación de
mejora
(-4.5, 4.0)
(-2.805, 3.131)
56
5
≈ 11× más rápido
(0.0, 0.0)
(3.000, 2.000)
160
7
≈ 23× más rápido
(4.5, -0.5)
(3.584, -1.848)
152
7
≈ 22× más rápido
(-3.5, -3.5)
(-3.779, -3.283)
38
4
≈ 9× más rápido
(5.0, 5.0)
(3.000, 2.000)
148
6
≈ 24× más rápido
El análisis confirma que el método de LevenbergMarquardt reduce drásticamente el
número de iteraciones necesarias para alcanzar el mismo nivel de error, combinando la rapidez
de GaussNewton con la estabilidad del descenso por gradiente.
En este contexto sobre redes neuronales, este comportamiento se traduce en una
optimización más eficiente del error de entrenamiento, una convergencia más estable y una
mejor generalización del modelo.
Caso 2. Entrenamiento de red neuronal y ajuste de función
La Figura 2 muestra el ajuste de una red neuronal MLP de una sola capa oculta (25
neuronas) para una función altamente no lineal y oscilatoria definida como:
DOI: https://doi.org/10.71112/fdzkm898
107 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
2
8( 0.4)
( ) (10 ) 0.5 (3.2 ) 0.2 (20 ) 0.3
x
f x xsen x sen x sen x e
−−
= + + +
(56)
Figura 2
Ajuste de función oscilatoria altamente no lineal
El modelo entrenado con el algoritmo LevenbergMarquardt (LM) logra reproducir con
gran precisión la forma general y los detalles finos de la función objetivo, incluso en regiones de
alta curvatura y comportamiento oscilatorio, mientras que el modelo basado en Gradiente
Descendente (GD) alcanza un ajuste aceptable, aunque presenta ligeras desviaciones en las
transiciones rápidas y una tendencia a suavizar los picos y valles característicos de la señal.
Esta diferencia se explica porque LM ajusta los pesos neuronales incorporando información de
segundo orden mediante la aproximación
()
T
J J I
+
, lo que le permite realizar pasos de
corrección s amplios y estables en direcciones de menor curvatura del error. En contraste,
GD se fundamenta únicamente en la pendiente del gradiente, lo que produce un avance más
lento y dependiente de la tasa de aprendizaje seleccionada, afectando la velocidad y la
estabilidad del proceso de convergencia.
DOI: https://doi.org/10.71112/fdzkm898
108 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
DISCUSIÓN
Los resultados obtenidos en las simulaciones 2D, 3D y en el entrenamiento de la red
neuronal confirman la superioridad del algoritmo LevenbergMarquardt (LM) frente al Gradiente
Descendente (GD). En los contornos bidimensionales, LM mostró trayectorias más directas y
rápidas hacia los mínimos, mientras que GD presentó rutas más largas y oscilatorias. En el
modelo tridimensional, LM descendió con mayor estabilidad por la superficie del error,
aprovechando la información de curvatura que GD ignora. De forma análoga, en el ajuste de la
función compleja, LM alcanzó una convergencia más rápida y precisa, reproduciendo fielmente
las variaciones del objetivo.
CONCLUSIONES
El estudio realizado demuestra que el algoritmo LevenbergMarquardt (LM) constituye
una alternativa altamente eficiente para el entrenamiento de redes neuronales multicapa y la
optimización de funciones no lineales. A partir de las simulaciones 2D y 3D, así como del
experimento de ajuste de una función compleja, se comprobó que LM alcanza los mínimos con
trayectorias más estables y directas, reduciendo de forma significativa el número de iteraciones
necesarias respecto al Gradiente Descendente (GD). Su capacidad para adaptar
dinámicamente el parámetro de amortiguamiento 𝜆 le permite equilibrar la rapidez de Gauss
Newton con la estabilidad del descenso por gradiente, logrando una convergencia más rápida,
precisa y menos sensible a las condiciones iniciales. En consecuencia, se concluye que LM es
un método robusto y confiable para optimizar el aprendizaje supervisado, mejorando la
eficiencia y la calidad del ajuste en redes neuronales aplicadas a problemas de alta
complejidad.
DOI: https://doi.org/10.71112/fdzkm898
109 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Declaración de conflicto de interés
El autor, Ernesto Antonio Morales Rodriguez, declara no tener ningún conflicto de interés
relacionado con esta investigación.
Declaración de contribución a la autoría
Ernesto Antonio Morales Rodriguez: conceptualización, curación de datos, análisis
formal, adquisición de fondos, investigación, metodología, administración del proyecto,
recursos, software, supervisión, validación, visualización, redacción del borrador original,
revisión y edición de la redacción.
Declaración de uso de inteligencia artificial
El autor, Ernesto Antonio Morales Rodriguez, declara que utilizo la inteligencia artificial
como apoyo para este artículo, y también que esta herramienta no sustituye de ninguna
manera la tarea o proceso intelectual. Después de rigurosas revisiones con diferentes
herramientas en la que se comprobó que no existe plagio como constan en las evidencias, el
autor manifiesta y reconoce que este trabajo fue producto de un trabajo intelectual propio, que
no ha sido escrito ni publicado en ninguna plataforma electrónica o de IA.
REFERENCIAS
A. Ranganath, I. R. (2024). Quasi-Adam: Accelerating Adam Using Quasi-Newton
Approximations. 2024 International Conference on Machine Learning and Applications
(ICMLA). https://doi.org/10.1109/icmla61862.2024.00107
Adhirai Subramaniyam, R. M. (2019). Taylor and Gradient Descent-Based Actor Critic Neural
Network for the Classification of Privacy Preserved Medical Data. Big data.
https://doi.org/10.1089/big.2018.0166
Adrien B. Taylor, J. H. (2015). Exact Worst-Case Performance of First-Order Methods for
Composite Convex Optimization. SIAM J. Optim. https://doi.org/10.1137/16m108104x
DOI: https://doi.org/10.71112/fdzkm898
110 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Adrien B. Taylor, Y. D. (2021). An optimal gradient method for smooth strongly convex
minimization. Mathematical Programming. https://doi.org/10.1007/s10107-022-01839-y
Alexandru Damian, E. N. (2022). Self-Stabilization: The Implicit Bias of Gradient Descent at the
Edge of Stability. ArXiv. https://doi.org/10.48550/arxiv.2209.15594
Antoine Lesage-Landry, J. A. (2020). Second-Order Online Nonconvex Optimization. IEEE
Transactions on Automatic Control. https://doi.org/10.1109/tac.2020.3040372
Aryan Mokhtari, Q. L. (2017). Network Newton Distributed Optimization Methods. IEEE
Transactions on Signal Processing. https://doi.org/10.1109/tsp.2016.2617829
C. Uriarte, M. B. (2024). Optimizing Variational Physics-Informed Neural Networks Using Least
Squares. ArXiv. https://doi.org/10.1016/j.camwa.2025.02.022
Chunfu Guo, Y. S. (2023). A combination of library search and Levenberg-Marquardt algorithm
in optical scatterometry. Thin Solid Films. https://doi.org/10.1016/j.tsf.2023.139670
D. Rotondo, M. J. (2024). A Weighted Linearization Approach to Gradient Descent Optimization.
2024 European Control Conference (ECC).
https://doi.org/10.23919/ecc64448.2024.10590954
Damien Lee, K. N.-H.-W. (2023). A Continual Learning Algorithm Based on Orthogonal Gradient
Descent Beyond Neural Tangent Kernel Regime. IEEE Access.
https://doi.org/10.1109/access.2023.3303869
Dongsheng Guo, Z.Y. N. (2017). Novel Discrete-Time Zhang Neural Network for Time-Varying
Matrix Inversion. IEEE Transactions on Systems, Man, and Cybernetics: Systems.
https://doi.org/10.1109/tsmc.2017.2656941
Gleich, D. (2017). TRUST REGION METHODS. https://doi.org/10.1007/978-0-387-40065-5_4
Hawraz N. Jabbar, B. A. (2021). Two-versions of descent conjugate gradient methods for large-
scale unconstrained optimization. Indonesian Journal of Electrical Engineering and
Computer Science. https://doi.org/10.11591/ijeecs.v22.i3.pp1643-1649
DOI: https://doi.org/10.71112/fdzkm898
111 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
Huanshui Zhang, H. W. (2024). Optimization methods rooted in optimal control. Sci. China Inf.
Sci. https://doi.org/10.1007/s11432-024-4207-5
Ivan Perez Avellaneda, L. A. (2023). Output Reachability of Chen-Fliess series: A Newton-
Raphson Approach. 2023 57th Annual Conference on Information Sciences and
Systems (CISS). https://doi.org/10.1109/ciss56502.2023.10089740
Jaehoon Lee, L. X.-D. (2019). Wide neural networks of any depth evolve as linear models under
gradient descent. Journal of Statistical Mechanics: Theory and Experiment.
https://doi.org/10.1088/1742-5468/abc62b
Jamie M. Taylor, D. P. (2022). A Deep Fourier Residual Method for solving PDEs using Neural
Networks. ArXiv. https://doi.org/10.48550/arxiv.2210.14129
Jesse Chan, C. G. (2020). Efficient computation of Jacobian matrices for entropy stable
summation-by-parts schemes. J. Comput. Phys.
https://doi.org/10.1016/j.jcp.2021.110701
John Taylor, W. W. (2022). Optimizing the optimizer for data driven deep neural networks and
physics informed neural networks. ArXiv. https://doi.org/10.48550/arxiv.2205.07430
Marcus Carlsson, V. N. (2025). The bilinear Hessian for large scale optimization. ArXiv.
https://doi.org/10.48550/arxiv.2502.03070
Mou Wu, N. X. (2020). RNN-K: A Reinforced Newton Method for Consensus-Based Distributed
Optimization and Control Over Multiagent Systems. IEEE Transactions on Cybernetics.
https://doi.org/10.1109/tcyb.2020.3011819
P. Baldi, K. C. (2016). Parameterized neural networks for high-energy physics. The European
Physical Journal C. https://doi.org/10.1140/epjc/s10052-016-4099-4
R. B. Yunus, N. Z.-Y. (2024). An improved accelerated 3-term conjugate gradient algorithm with
second-order Hessian approximation for nonlinear least-squares optimization. Journal
of Mathematics and Computer Science. https://doi.org/10.22436/jmcs.036.03.02
DOI: https://doi.org/10.71112/fdzkm898
112 Revista Multidisciplinar Epistemología de las Ciencias | Vol. 3, Núm. 3, 2026, julio-septiembre, Edición Especial
R. Dehghani, M. M. (2018). The modified quasiNewton methods for solving unconstrained
optimization problems. International Journal of Numerical Modelling: Electronic
Networks. https://doi.org/10.1002/jnm.2459
Shuvomoy Das Gupta, R. F. (2023). Nonlinear conjugate gradient methods: worst-case
convergence rates via computer-assisted analyses. Mathematical Programming.
https://doi.org/10.1007/s10107-024-02127-7
Taylor Simons, D.-J. L. (2019). A Review of Binarized Neural Networks. Electronics.
https://doi.org/10.3390/electronics8060661
Weilong Liao, Q. Z. (2022). An SQP Algorithm for Structural Topology Optimization Based on
MajorizationMinimization Method. Applied Sciences.
https://doi.org/10.3390/app12136304
Yuan-Yuan Cheng, L. L.-M. (2025). Eigenvalue Blending for Projected Newton. Computer
Graphics Forum. https://doi.org/10.1111/cgf.70027
Yunjin Tong, S. X. (2020). Symplectic Neural Networks in Taylor Series Form for Hamiltonian
Systems. ArXiv. https://doi.org/10.1016/j.jcp.2021.110325
Zheyuan Hu, Z. S. (2023). Hutchinson Trace Estimation for High-Dimensional and High-Order
Physics-Informed Neural Networks. ArXiv. https://doi.org/10.1016/j.cma.2024.116883