Noticias sobre arXiv CS.SE
4 artículos relacionados
Actualización del infierno: ¿Pueden los agentes codificadores sobrevivir a fallas ocultas en las actualizaciones de dependencia?
Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency Upgrades?
AI InsightEl punto de referencia DEPBENCH es el primero en evaluar sistemáticamente el rendimiento de los agentes de codificación en escenarios donde las actualizaciones de dependencia ocultan daños. En comparación con la investigación existente que se centra en problemas de compatibilidad directa, se centra en cambios implícitos como firmas de funciones y sistemas de tipos, lo que revela los riesgos de comunicación no explícitos que pueden encontrar los agentes. Esto significa que la evaluación de la fiabilidad de los agentes codificadores se está ampliando a escenarios de mantenimiento reales.Importancia 70/100Sobre las perspectivas de conversaciones dinámicas de LLM en desarrollo de software
On the Prospects of Dynamic LLM Conversations in Software Development
AI InsightarXiv publicó un estudio sobre el diálogo dinámico de LLM en el desarrollo de software, evaluando el impacto de la intervención externa, como la conciencia del contexto, en la calidad de la interacción entre los desarrolladores y el LLM. En comparación con el estudio anterior que solo se centró en cómo los desarrolladores escriben palabras clave, este estudio se centra en intervenir activamente en el proceso de interacción para reducir la dependencia de la ingeniería de palabras clave.Importancia 60/100EntidadesarXiv CS.SEComportamiento emergente e incertidumbre en los procesos comerciales mejorados por IoT: desafíos y direcciones futuras
Emergent Behavior and Uncertainty in IoT-Enhanced Business Processes: Challenges and Future Directions
AI InsightEl artículo de arXiv señala que en los procesos de negocio mejorados por IoT, las interacciones complejas provocan un comportamiento emergente en tiempo de ejecución. En comparación con el BPM tradicional que se basa en supuestos estáticos, este fenómeno introduce observabilidad e incertidumbre parciales, desafiando los supuestos de gestión existentes.Importancia 60/100Evaluación de un LLM local de pesos abiertos 4B para flujos de trabajo DFT agentes: una auditoría de reproducibilidad de la literatura
Evaluating a 4B open-weights local LLM for agentic DFT workflows: a literature reproducibility audit
AI InsightInvestigar el uso del modelo nativo de peso abierto Qwen3:4B con parámetros 4B para realizar flujos de trabajo de simulación DFT autónomos en ciencia de materiales. En comparación con agentes científicos anteriores que dependían de modelos de alojamiento comerciales, esta vez utiliza una arquitectura neurosimbólica (propuesta de agente, ejecución de código determinista) y razonamiento múltiple para resolver los problemas de reproducibilidad y estabilidad estructural de pequeños modelos locales bajo restricciones de hardware. Esto demuestra la viabilidad de los modelos locales a pequeña escala como alternativa a los modelos de negocio alojados en determinados procesos científicos, reduciendo la privacidad y los costes económicos.Importancia 68/100