Saltar al contenido
Mohring Tech
IA generativa

Modelos de lenguaje abiertos para programar los PLC de una planta, qué tanto ayuda darles el manual

Un estudio de Taiwán probó diez modelos de código abierto escribiendo programas para controladores Mitsubishi. Sin documentación fallan mucho; con recuperación de manuales, el mejor pasa el control de sintaxis en 95,8 % de los casos.

Enrique Barraza Mohring27 de setiembre de 20263 min de lectura

Estaciones de automatización industrial con pantallas de control y módulos electrónicos.
Foto: Ludovic Delot / Pexels

Qué encontraron

En casi cualquier planta industrial, desde una línea de envasado hasta una secadora de granos, hay un controlador lógico programable, un PLC, que convierte las señales de los sensores en órdenes para motores, válvulas y luces. Muchos de esos equipos son antiguos y se programan en lenguajes que casi nadie enseña ya. Uno de ellos es la Lista de Instrucciones de los controladores Mitsubishi de la serie FX, retirada del estándar internacional pero todavía muy usada en talleres y plantas pequeñas y medianas de Asia.

Un equipo de la Universidad de Ciencia y Tecnología Lunghwa, en Taiwán, se preguntó si los modelos de lenguaje abiertos, que una empresa puede instalar en sus propias computadoras sin enviar datos a la nube, pueden escribir programas en ese lenguaje. Probó diez modelos de cinco empresas, de Meta, Alibaba, Mistral, OpenAI y NVIDIA, en tres niveles de hardware, con 285 preguntas de programación.

Cada modelo se probó de dos formas: solo, y con generación aumentada por recuperación (RAG), una técnica que busca fragmentos relevantes de manuales y ejemplos y se los entrega al modelo junto con la pregunta. Para medir, los autores construyeron un verificador que revisa si el código generado usa instrucciones válidas, con el formato correcto y una estructura coherente.

Resultados:

  • Sin ayuda, fallan. Los modelos solos suelen inventar instrucciones que no existen o responder con explicaciones en vez de código.
  • Con los manuales, mejoran mucho. La recuperación de documentación subió la tasa de aprobación entre 6,7 y 61,1 puntos según el modelo. La mediana de mejora fue de 47 puntos.
  • El mejor supera a la referencia. El modelo más grande de Alibaba con recuperación aprobó 95,8 % de los casos, por encima del 93,3 % que obtuvieron las propias respuestas de referencia en el verificador.
  • No todos responden igual. Dos modelos grandes casi no mejoraron; los autores los reportan en lugar de excluirlos.

Qué significa

La lectura práctica es que, para tareas técnicas muy específicas, darle al modelo la documentación correcta pesa más que usar el modelo más famoso. Un modelo abierto, instalado dentro de la empresa y alimentado con los manuales de sus propios equipos, puede ser útil para mantener y modificar programas de máquinas antiguas, sin exponer información de la planta.

Nuestra interpretación es que esto aplica a mucho más que los PLC: cualquier planta con documentación técnica propia, manuales de equipos importados o procedimientos internos podría usar esta combinación. Pero el estudio también muestra el límite: el verificador solo comprueba que el código esté bien escrito, no que haga lo correcto.

Límites

  • Sintaxis, no funcionamiento. Los autores insisten en que aprobar el verificador significa «no está muerto», no «listo para la planta». Muestran un programa que intercambia dos botones y aun así aprueba.
  • Un solo fabricante. Solo se evaluaron controladores Mitsubishi de la serie FX.
  • Tareas básicas. El conjunto excluye control PID, comunicaciones, control de movimiento y programas por etapas, justamente los más delicados en una planta.
  • Categorías desbalanceadas. Dos categorías tienen solo diez preguntas, así que un error mueve el resultado diez puntos.

Por qué importa en el Perú y la región

Muchas plantas de proceso en el Perú, de café, frutas o granos, operan con maquinaria importada que trae su propia documentación y controladores de distintas marcas y épocas. Un asistente con IA generativa alimentado con esos manuales podría acelerar el mantenimiento y la capacitación de técnicos. La condición, según este estudio, es no saltarse la prueba en simulador o en máquina antes de cargar un programa.

La investigación

Multi-Hardware Benchmarking of Open-Source Large Language Models with Retrieval-Augmented Generation for Mitsubishi FX-Series PLC Instruction List Code Generation

Autores
Yeh MF, Luo CC, Lu CL
Publicado en
Sensors, 2026
Revisión por pares
Sí
Licencia
CC BY 4.0
DOI
10.3390/s26113602
Repositorio
Europe PMC. Ver el paper original

Para el debate

En una planta de proceso con controladores antiguos, ¿quién debería revisar y firmar un programa generado con IA antes de cargarlo en la máquina?

Responde a hola@mohring.tech. Las mejores respuestas se publican en el boletín.

Fragmentos citados del paper (8)
  1. Programar PLC en lenguajes antiguos como la Lista de Instrucciones de Mitsubishi sigue siendo tarea de expertos, y ese lenguaje está poco representado en los datos con que se entrenan los modelos.

    Generating PLC programs in legacy textual languages such as Mitsubishi FX-series Instruction List (IL) remains an expert-only task, and IL’s deprecation in IEC 61131-3 Edition 3.0 leaves it under-represented in the corpora that train modern large language models (LLMs).
  2. Evaluaron diez modelos abiertos, de cinco empresas, con y sin generación aumentada por recuperación, sobre 285 preguntas.

    We benchmark ten open-source LLMs (five vendors, 7B–122B parameters) in both LLM-only and Retrieval-Augmented Generation (RAG) configurations on a frozen 285-question dataset
  3. Sin ayuda, los modelos suelen inventar instrucciones inexistentes o devolver pseudocódigo en prosa.

    consequently, off-the-shelf LLMs frequently fabricate non-existent mnemonics, mismatch operand counts, or output prose pseudocode in place of compilable instructions.
  4. La recuperación de documentación subió la tasa de aprobación sintáctica entre 6,7 y 61,1 puntos, y la mejor configuración llegó a 95,8 %.

    RAG raises the syntactic pass rate by + 6.7 to + 61.1 percentage points across all ten models; the best configuration, qwen3.5:122b with RAG, reaches 95.8 % , exceeding the ground-truth baseline.
  5. El verificador de sintaxis se calibró con una tasa de aprobación de 93,3 % en las respuestas de referencia.

    To move beyond lexical similarity we introduce a three-tier static syntax checker (Lexical/Syntactic/Semantic) calibrated against a 93.3 % ground-truth pass rate.
  6. Los autores reportan dos casos que casi no mejoraron, en vez de excluirlos.

    We report two negative findings prominently: llama3.3:70b gains only + 6.7 percentage points in syntactic pass rate from RAG, versus a median of + 47 pp; gpt-oss:120b gains only + 25.6 pp with the lowest absolute RAG pass rate ( 43.9 % ) among the four XL models.
  7. Pasar el verificador no significa que el programa funcione; puede intercambiar botones y aun así aprobar.

    Section 3.4 gives a worked example of a program that swaps X0 for X1 and yet passes every tier; such a program is syntactically valid but functionally wrong.
  8. El conjunto de preguntas excluye control PID, comunicaciones, control de movimiento y programas por etapas.

    The corpus deliberately excludes four important program classes that practising automation engineers do encounter on FX-series hardware and that we explicitly do not claim our results generalize to

Redactado por un agente de IA (claude-opus-5-5) a partir del paper citado y verificado de forma automática contra la fuente antes de publicarse: cifras, DOI, retracciones y licencia. ¿Encontraste un error? Escribe a hola@mohring.tech; la corrección se publica con fecha al pie.

Mohring Tech desarrolla aplicaciones con IA generativa para empresas del agro y la industria. Conoce las soluciones

Recibe lo más importante de la semana.

Un correo los lunes con los artículos de los temas que elijas.

Suscríbete gratis