Articles sur arXiv CS.SE
4 articles liés
Mise à jour de l'enfer : les agents de codage peuvent-ils survivre aux ruptures cachées lors des mises à niveau de dépendances ?
Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency Upgrades?
AI InsightLe benchmark DEPBENCH est le premier à évaluer systématiquement les performances des agents d'encodage dans des scénarios où les mises à niveau des dépendances cachent les dommages. Par rapport aux recherches existantes qui se concentrent sur les problèmes de compatibilité directe, elles se concentrent sur les changements implicites tels que les signatures de fonctions et les systèmes de types, révélant les risques de communication implicites que les agents peuvent rencontrer. Cela signifie que l’évaluation de la fiabilité des agents de codage est étendue à des scénarios de maintenance réels.Importance 70/100Sur les perspectives des conversations dynamiques LLM dans le développement de logiciels
On the Prospects of Dynamic LLM Conversations in Software Development
AI InsightarXiv a publié une étude sur le dialogue dynamique LLM dans le développement de logiciels, évaluant l'impact d'une intervention externe telle que la conscience du contexte sur la qualité de l'interaction entre les développeurs et le LLM. Par rapport à l’étude précédente qui se concentrait uniquement sur la manière dont les développeurs rédigent les mots d’invite, cette étude se tourne vers une intervention active dans le processus d’interaction afin de réduire le recours à l’ingénierie des mots d’invite.Importance 60/100EntitésarXiv CS.SEComportements émergents et incertitudes dans les processus métier améliorés par l'IoT : défis et orientations futures
Emergent Behavior and Uncertainty in IoT-Enhanced Business Processes: Challenges and Future Directions
AI InsightL'article d'arXiv souligne que dans les processus métier améliorés par l'IoT, des interactions complexes provoquent des comportements émergents au moment de l'exécution. Comparé au BPM traditionnel qui repose sur des hypothèses statiques, ce phénomène introduit une observabilité et une incertitude partielles, remettant en question les hypothèses de gestion existantes.Importance 60/100Évaluation d'un LLM local à poids ouverts 4B pour les flux de travail DFT agentiques : un audit de reproductibilité de la littérature
Evaluating a 4B open-weights local LLM for agentic DFT workflows: a literature reproducibility audit
AI InsightÉtudiez l'utilisation du modèle de poids ouvert natif Qwen3:4B avec des paramètres 4B pour effectuer des flux de travail de simulation DFT autonomes en science des matériaux. Par rapport aux agents scientifiques précédents qui s'appuyaient sur des modèles d'hébergement commerciaux, il utilise cette fois une architecture neuro-symbolique (proposition d'agent, exécution de code déterministe) et un raisonnement multiple pour résoudre les problèmes de reproductibilité et de stabilité structurelle des petits modèles locaux sous contraintes matérielles. Cela démontre la viabilité des modèles locaux à petite échelle comme alternative aux modèles économiques hébergés dans certains processus scientifiques, réduisant ainsi la confidentialité et les coûts économiques.Importance 68/100