Redes Neuronales Artificiales
Este elemento es una ampliación de los cursos y guías de Lawi. Ofrece hechos, comentarios y análisis sobre este tema. [aioseo_breadcrumbs] Los clasificadores polinómicos pueden modelar superficies de decisión de cualquier forma; sin embargo, su utilidad práctica es limitada debido a la facilidad con la que superan a los ruidosos datos de entrenamiento y al número a veces poco práctico de parámetros entrenables. Mucho más populares son las redes neuronales artificiales, en las que muchas unidades simples, denominadas neuronas, están interconectadas por enlaces ponderados en estructuras más grandes de notable rendimiento.
El campo de las redes neuronales es demasiado rico para ser cubierto en el espacio que tenemos a nuestra disposición. (Tal vez sea de interés más investigación sobre el concepto).
Una Conclusión
Por lo tanto, solo proporcionaremos la información básica sobre dos tipos populares: los perceptrones multicapa y las redes de función de base radial.Entre las Líneas En el texto se describe cómo cada una de ellas clasifica los ejemplos, y luego se describen algunos mecanismos elementales para inducirlas a partir de los datos de formación.
Observaciones históricas
La investigación de las redes neuronales fue retrasada por las opiniones escépticas formuladas por Minsky y Papert. El pesimismo expresado por tales autores famosos fue probablemente la razón principal por la que una versión temprana de la formación de redes neuronales por Bryson y Ho fue en gran parte pasada por alto, un destino que pronto será compartido por un intento independiente y exitoso de Werbos. Sólo después de la publicación de los innovadores volúmenes de Rumelhart y McClelland, en los que se reinventó el algoritmo de forma independiente, el campo de las redes neuronales artificiales se estableció como una disciplina científica respetable. El crecimiento gradual del perceptrón multicapa fue propuesto por Ash. La idea de las funciones de base radial fue lanzada por primera vez en el escenario de las redes neuronales por Broomhead y Lowe.
Los perceptrones multicapa como clasificadores
A lo largo de esta entrada, supondremos que todos los atributos son continuos.
Otros Elementos
Además, es práctico (aunque no estrictamente necesario) suponer que se han normalizado de manera que sus valores caen siempre en el intervalo [-1, 1].
Neuronas
La función de una neurona, la unidad básica de un perceptrón multicapa, es bastante simple. Una suma ponderada de las señales que llegan a la entrada se somete a una función de transferencia. Se pueden utilizar varias funciones de transferencia diferentes; la que se prefiere en esta entrada es la denominada sigmoide.
Perceptrón multicapa
En la red neural que se conoce como el perceptrón multicapa, las neuronas, representadas por óvalos, están dispuestas en la capa de salida y en la capa oculta. Para simplificar, consideraremos solo las redes con una sola capa oculta, recordando que es bastante común emplear dos de estas capas, incluso tres, aunque raramente más que eso. Otra simplificación es que hemos omitido los pesos cero (proporcionando a cada neurona su sesgo entrenable) para no desordenar el cuadro.
Mientras que no hay comunicación entre las neuronas de la misma capa, las capas adyacentes están totalmente interconectadas. Lo importante es que cada enlace neurona a neurona está asociado (véase qué es, su concepto jurídico; y también su definición como “associate” en derecho anglo-sajón, en inglés) a un peso.
Propagación hacia adelante
Cuando presentamos la red con un ejemplo, x = (x 1, …, x n), sus valores de atributo se pasan a lo largo de los enlaces a las neuronas.
Los clasificadores universales
Los matemáticos han sido capaces de probar que, con la elección correcta de los pesos, y con el número correcto de las neuronas ocultas, por ejemplo puede aproximar con arbitraria exactitud cualquier función realista. La consecuencia de este así llamado teorema de universalidad es que el perceptrón multicapa puede en principio utilizarse para abordar casi cualquier problema de clasificación. (Tal vez sea de interés más investigación sobre el concepto).
Puntualización
Sin embargo, lo que el teorema no nos dice es cuántas neuronas ocultas se necesitan, y cuáles deberían ser los valores de peso individuales.Entre las Líneas En otras palabras, sabemos que la solución existe, pero no hay garantía de que la encontremos.
Error de la red neuronal
Dejemos para otro lugar la explicación de una técnica para entrenar el perceptrón multicapa (para encontrar sus pesos). Antes de poder abordar esta cuestión, es necesario preparar el suelo examinando más de cerca el método de clasificación y la forma en que se evalúa la exactitud de esta clasificación.
La retropropagación del error
En el perceptrón multicapa, los parámetros que afectan el comportamiento de la red son los conjuntos de pesos, w ji (1) y w kj (2). La tarea para el aprendizaje automático es encontrar para estos pesos tales valores que optimicen el rendimiento (véase una definición en el diccionario y más detalles, en la plataforma general, sobre rendimientos) de la clasificación de la red. Al igual que en el caso de los clasificadores lineales, esto se logra mediante el entrenamiento. Esta sección está dedicada a una técnica popular capaz de realizar esta tarea.
El Escenario General
En principio, el procedimiento es el mismo que en el caso del aprendizaje automatizado (véase). Al principio, los pesos se inicializan en pequeños números aleatorios, típicamente del intervalo (-0. 1, 0. 1). Después se presentan los ejemplos de entrenamiento, uno por uno, y cada uno de ellos es propagado hacia la salida de la red. La discrepancia entre esta salida y el vector objetivo del ejemplo nos indica entonces cómo modificar los pesos (ver más abajo). Después de la modificación de los pesos, se presenta el siguiente ejemplo. Cuando se ha alcanzado el último ejemplo de entrenamiento, se ha completado una época.Entre las Líneas En los perceptrones multicapa, el número de épocas necesarias para un entrenamiento exitoso es mucho mayor que en el caso de los clasificadores lineales: puede ser de miles, decenas de miles, incluso más.
Aspectos especiales de las percepciones multicapas
La limitación de espacio nos impide la investigación detallada de las muchas características que hacen que el entrenamiento de percepciones multicapas sea más arte que ciencia. Para hacer justicia a todos ellos, se necesitaría un largo texto, superior en tamaño, al de este texto. Aún así, el conocimiento de ciertos aspectos críticos es vital para que el entrenamiento tenga éxito.
Una Conclusión
Por lo tanto, repasemos brevemente algunos de los más importantes.
Costos computacionales
La retropropagación del error es costosa desde el punto de vista computacional. Al presentar un ejemplo, hay que calcular la responsabilidad de cada neurona individual, y luego modificar los pesos en consecuencia. Esto tiene que ser repetido para todos los ejemplos de entrenamiento, generalmente para muchas épocas. Para tener una idea de los costos (o costes, como se emplea mayoritariamente en España) reales de todo esto, considérese una red que consiste en clasificar los ejemplos descritos por 100 atributos, un caso bastante realista. Si hay 100 neuronas ocultas, entonces el número de pesos en esta capa inferior es 100 × 100 = 104. Este es entonces el número de cambios de peso después de cada ejemplo de entrenamiento. Obsérvese que los pesos de la capa superior pueden ser descuidados, en estos cálculos, siempre que el número de clases sea pequeño. Por ejemplo, en un dominio con tres clases, el número de pesos de la capa superior es 100 × 3 = 300 que es mucho menos que 104.
Supongamos que el conjunto de entrenamiento consiste en 105 ejemplos, y supongamos que el entrenamiento continuará durante 104 épocas.Entre las Líneas En este caso, el número de actualizaciones de pesos será 104 × 105 × 104 = 1013. Esto parece mucho, pero muchas aplicaciones son aún más exigentes.
Una Conclusión
Por lo tanto, se han desarrollado algunos métodos bastante ingeniosos para hacer el entrenamiento más eficiente. Estos, sin embargo, están fuera del alcance de nuestro interés aquí.
Valores objetivo revisados
Para simplificar, hasta ahora hemos asumido que cada valor objetivo es 1 o 0. Esta puede no ser la mejor opción. (Tal vez sea de interés más investigación sobre el concepto). Por un lado, estos valores nunca pueden ser alcanzados por la salida de una neurona, y i.
Los mínimos locales
Aquí se trata el principal inconveniente del enfoque de gradiente-descenso cuando se adoptaba el entrenamiento con perceptrón de múltiples capas. Los pesos se cambian de manera que se garantiza el descenso a lo largo de la pendiente más pronunciada.Si, Pero: Pero una vez que se ha alcanzado el fondo de un mínimo local, no hay ningún otro lugar a donde ir, lo que es incómodo: después de todo, el objetivo final es alcanzar el mínimo global. Aquí se necesitan dos cosas: primero, un mecanismo para reconocer el mínimo local; segundo, un método para recuperarse de haber caído en uno.
Una posibilidad de identificar oportunamente los mínimos locales durante el entrenamiento es hacer un seguimiento del error cuadrático medio y resumirlo en todo el conjunto de entrenamiento al final de cada época.Entre las Líneas En circunstancias normales, esta suma tiende a bajar de una época a otra. Una vez que parece haber llegado a una meseta en la que apenas se puede observar una reducción del error, se sospecha que el proceso de aprendizaje está atrapado en un mínimo local.
Las técnicas para superar esta dificultad suelen basarse en tasas de aprendizaje adaptativas (véase más abajo), y en la adición de nuevas neuronas ocultas.Entre las Líneas En general, el problema es menos crítico en redes con muchas neuronas ocultas.
Otros Elementos
Además, los mínimos locales tienden a ser más superficiales, y menos frecuentes, si todos los pesos son muy pequeños, por ejemplo, a partir del intervalo (-0. 01, 0. 01).
Tasa de Aprendizaje Adaptativo
Al describir la retropropagación del error, asumimos que la tasa de aprendizaje establecida por el usuario, η, era una constante. Esto, sin embargo, es raramente el caso en aplicaciones realistas. Muy a menudo, el entrenamiento comienza con un gran η que luego disminuye gradualmente en el tiempo. La motivación es fácil de adivinar. Al principio, los mayores cambios de peso reducen el número de épocas, e incluso pueden ayudar al alumno a “saltar” algunos mínimos locales.
Puntualización
Sin embargo, más adelante, este gran η podría llevar a “saltarse” el mínimo global, y por eso su valor debería disminuir.
Sobreentrenamiento
Las percepciones multicapas comparten con los clasificadores polinómicos una propiedad desagradable.Entre las Líneas En teoría, son capaces de modelar cualquier superficie de decisión, y esto los hace propensos a sobrecargar los datos de entrenamiento. El lector recuerda que la sobreadaptación suele significar la clasificación perfecta de ejemplos de formación ruidosos, lo que inevitablemente va seguido de un rendimiento (véase una definición en el diccionario y más detalles, en la plataforma general, sobre rendimientos) decepcionante en el futuro.
Para los pequeños perceptivos multicapa, este problema no es tan doloroso; no son lo suficientemente flexibles como para sobreajustarse.Si, Pero: Pero a medida que aumenta el número de neuronas ocultas, la red gana en flexibilidad, y la sobreadaptación puede convertirse en una verdadera preocupación. (Tal vez sea de interés más investigación sobre el concepto).
Puntualización
Sin embargo, como aprenderemos en la siguiente sección, esto no significa que siempre debamos preferir las redes pequeñas!
Hay una forma sencilla de descubrir si el proceso de entrenamiento ha alcanzado la etapa de “overfitting”. Si el conjunto de la formación es lo suficientemente grande, podemos permitirnos dejar de lado unos 10-20% de ejemplos. Estos nunca se utilizarán para la retropropagación de errores, sino que después de cada época se calcula la suma de los errores medios cuadrados de estos ejemplos retenidos. Al principio, la suma tenderá a bajar, pero solo hasta cierto momento; luego comienza a crecer de nuevo, alertando al ingeniero de que la formación ha comenzado a superar los datos.
Cuestiones de arquitectura
Hasta ahora, se ha descuidado una pregunta importante: ¿cuántas neuronas ocultas hay que usar? Si solo hay una o dos, la red carecerá de flexibilidad; no solo será incapaz de modelar una superficie de decisión complicada, sino que el entrenamiento de esta red será propenso a quedarse atascado en un mínimo local.Entre las Líneas En el otro extremo, el uso de miles de neuronas no solo aumentará los costos (o costes, como se emplea mayoritariamente en España) de computación debido a la necesidad de entrenar tantas neuronas. La red será más flexible de lo necesario. Como resultado, se adaptará fácilmente a los datos. Como es habitual, en situaciones de este tipo, hay que encontrar algún compromiso.
Rendimiento frente a tamaño
Supongamos que decides realizar el siguiente experimento. El conjunto disponible de ejemplos preclasificados se divide en dos partes, una para el entrenamiento, la otra para la prueba. El entrenamiento se aplica a varias redes neuronales, cada una con un número diferente de neuronas ocultas. Las redes se entrenan hasta que no se observa una reducción de la tasa de error del conjunto de entrenamiento. Después de esto, se mide la tasa de error en los datos de la prueba.
Redes de función de base radial
El comportamiento de una neurona de salida en los perceptrones multicapa es similar al de un clasificador lineal. Como tal, se puede esperar que le vaya mal en dominios con clases que no son linealmente separables.
Puntualización
Sin embargo, en el contexto de las redes neuronales, esta limitación no es necesariamente perjudicial. La cosa es que los ejemplos originales han sido transformados por las funciones sigmoides en la capa oculta.Entre las Líneas En consecuencia, las neuronas de la capa de salida se ocupan de nuevos “atributos”, los obtenidos por esta transformación. (Tal vez sea de interés más investigación sobre el concepto).Entre las Líneas En el proceso de formación, estos ejemplos transformados (las salidas de las neuronas ocultas) pueden llegar a ser linealmente separables de manera que las neuronas de la capa de salida puedan separar las dos clases sin dificultades.
Datos verificados por: LI
Redes neuronales artificiales en Economía
En inglés: Artificial Neural Networks in economics. Véase también acerca de un concepto similar a Redes neuronales artificiales en economía.
Introducción a: Redes neuronales artificiales en este contexto
Las redes neuronales artificiales (RNA) constituyen una clase de modelos no lineales flexibles diseñados para imitar los sistemas neuronales biológicos. En este texto introducimos las RNA utilizando una terminología econométrica familiar y proporcionamos una visión general del enfoque de modelización de las RNA y sus métodos de implementación. Este texto tratará de equilibrar importantes preocupaciones teóricas con debates empíricos clave para ofrecer una visión general de este importante tema sobre: Redes neuronales artificiales. Para tener una panorámica de la investigación contemporánea, puede interesar asimismo los textos sobre economía conductual, economía experimental, teoría de juegos, microeconometría, crecimiento económico, macroeconometría, y economía monetaria.
Basado en la experiencia de varios autores, mis opiniones, perspectivas y recomendaciones se expresarán a continuación (o en otros lugares de esta plataforma, respecto a las características en 2026 o antes, y el futuro de esta cuestión):
Datos verificados por: Sam.
[rtbs name=”economia-fundamental”] [rtbs name=”macroeconomia”] [rtbs name=”microeconomia”] [rtbs name=”economia-internacional”] [rtbs name=”finanzas-personales”] [rtbs name=”ciencia-economica”] [rtbs name=”pensamiento-economico”] [rtbs name=”principios-de-economia”] [rtbs name=”mercados-financieros”] [rtbs name=”historia-economica”] [rtbs name=”sistemas-economicos”] [rtbs name=”politicas-economicas”]Recursos
[rtbs name=”informes-jurídicos-y-sectoriales”][rtbs name=”quieres-escribir-tu-libro”]Véase También
Clasificadores bayesianos, teoría de aprendizaje computacional, árboles de decisión, algoritmos genéticos, clasificadores lineales y polinómicos, clasificador del vecino más cercano, redes neuronales, evaluación del rendimiento, aprendizaje de refuerzo, aprendizaje estadístico, clases variables en el tiempo, representación desequilibrada, inteligencia artificial, datos de aprendizaje automático, minería de aprendizaje profundo, aprendizaje no supervisado
Memoria temporal jerárquica
20Q
ADALINE
Teoría de la resonancia adaptativa
Vida artificial
Memoria asociativa
Autoencoder
La robótica del rayo
Cibernética biológica
Computación inspirada en la biología
Proyecto Cerebro Azul
Interferencia catastrófica
Controlador de la Articulación del Modelo Cerebeloso (CMAC)
Arquitectura cognitiva
Ciencia cognitiva
Red neuronal convolucional (CNN)
Sistema experto de conexión
Connectomics
Redes neuronales cultivadas
Aprendizaje profundo
Encog
Lógica difusa
Programación de la expresión genética
Algoritmo genético
Programación genética
Método de grupo de manejo de datos
Habituación
Tabulación adaptativa in situ
Conceptos de aprendizaje automático
Modelos de computación neural
Neuroevolución
Codificación neuronal
El gas neural
Traducción automática neuronal
El software de la red neuronal
Neurociencia
Identificación de sistemas no lineales
Red neural óptica
Procesos paralelos de satisfacción de limitaciones
Procesamiento distribuido en paralelo
Red de funciones de base radial
Redes neuronales recurrentes
Mapa auto-organizado
Red neuronal de picos
Matriz sistólica
La red de productos Tensor
Red neuronal de retardo temporal (TDNN)
Aprendizaje profundo
Dinámica de sistemas
Inteligencia artificial
Inteligencia computacional
Internet de las cosas
Sistema dinámico
Minería de datos
Inteligencia artificial
Dinámica de sistemas
Sistema complejo
Sistema dinámico
Robótica evolutiva
Conformación de haces (beamforming)
Cerebro artificial
Redes neuronales convolucionales
Perceptrón multicapa
Deep Dream
Reconocimiento de patrones
Reglas de asociación
Robot autónomo
Sistema complejo
Redes neuronales artificiales
Representación del conocimiento
Equidad (aprendizaje automático)
Análisis predictivo – Técnicas estadísticas que analizan los hechos para hacer predicciones sobre eventos desconocidos
El aprendizaje de las máquinas cuánticas
Aplicaciones del aprendizaje a máquina en bioinformática
Seq2seq
Equidad (aprendizaje automático)
Ciencias de la computación, minería de datos, Descubrimiento de conocimientos, Grandes datos, Análisis de datos, inteligencia computacional, Inteligencia artificial, Visión por computadora, Cibernética, Aprendizaje Profundo, Algoritmos de clasificación, Estadística computacional, Neurociencia computacional, Investigación de mercado, Segmentación de mercado, Psicología matemática, Métodos económicos matemáticos, Métodos económicos cuantitativos
▷ Esperamos que haya sido de utilidad. Si conoces a alguien que pueda estar interesado en este tema, por favor comparte con él/ella este contenido. Es la mejor forma de ayudar al Proyecto Lawi.
El peso del enlace de la neurona oculta j-ésimo a la neurona de salida i-ésimo se denota como w ji (1), y el peso del enlace del atributo k-ésimo a la neurona oculta j-ésimo como w kj (2). Obsérvese que el primer índice siempre se refiere al “comienzo” del enlace; el segundo, a su “final”.