ACTUALITÉS
Article et modèle de fondation open source sur les données tabulaires : SAP-RPT-1-OSS

Nous avons publié notre article de recherche ConTextTab à NeurIPS 2025 (article Spotlight) et mis à disposition une version open weight de notre modèle sous le nom de SAP-RPT-1-OSS.

En savoir plus

Qui sommes-nous

placeholder

Chez SAP Business AI Research, nous faisons le pont entre le monde universitaire et l’industrie, avec l’ambition de faire progresser les systèmes d’IA de nouvelle génération. Nos recherches répondent aux complexités des environnements d’entreprise réels en associant des techniques d’IA de pointe aux défis spécifiques à chaque domaine. Nous nous concentrons sur deux axes de recherche principaux afin de veiller à ce que nos modèles soient non seulement puissants, mais aussi pratiques, fiables et évolutifs.

Domaines de recherche

Track A : modèles de fondation tenant compte de la structure

Nous développons des modèles fondamentaux capables de raisonner sur des données d’entreprise complexes et liées, couvrant des tableaux, des séries chronologiques et des graphes. En intégrant la compréhension structurelle, des entrées multimodales et le raisonnement causal, nos modèles permettent une IA métier avancée pour l’analyse, les prévisions et la prise de décision.

Apprentissage de représentations de tableaux

Apprentissage des représentations de données tabulaires via des modèles natifs des tableaux et basés sur le langage, intégrant les données d’entreprise pour un raisonnement avancé.

Réseaux neuronaux de graphes

Utilisation des réseaux de neurones graphiques pour modéliser des données tabulaires relationnelles, permettant des prédictions précises et des insights plus approfondis dans l'IA d'entreprise.

Graphe de connaissances d'entreprise

Création de graphes de connaissances d’entreprise pour permettre des requêtes précises et contextuelles sur diverses données d’entreprise.

IA agentique

Créer des agents capables de s’auto-améliorer pour une automatisation fiable et axée sur les objectifs dans les systèmes d’entreprise.

LLM de codage (ABAP)

Renforcer le développement de logiciels d’entreprise grâce à des modèles de base ABAP spécifiques au domaine pour une assistance intelligente au codage.

Piste B : IA fiable

Nos recherches développent des systèmes d’IA robustes, équitables, transparents et alignés sur les valeurs humaines, ce qui est essentiel pour une utilisation concrète en entreprise. Nous nous concentrons sur la robustesse, l’explicabilité, l’équité, la confidentialité et l’alignement sur les contraintes propres au domaine afin de garantir un déploiement fiable et responsable de l’IA.

Confidentialité différentielle

Nous développons des modèles de Deep Learning efficaces qui économisent les ressources et protègent la confidentialité.

Confidentialité des données

Nous garantissons la confidentialité des données en protégeant les données structurées et en validant la protection de la vie privée au moyen d'audits et d'attaques.

Protection des modèles

Analyse des sentiments dans le texte à l'aide de plongements neuronaux et de l'attention.

Tests de sécurité

Améliorer la transparence des modèles en rendant les prédictions explicables.

Alignement humain

Extraction de données à partir de documents à l'aide du NLP et de la vision par ordinateur.

Carrières

placeholder

Rejoignez-nous et bâtissez l'avenir de l'IA d'entreprise

Travaillez avec des jeux de données riches pour trouver des solutions basées sur le Machine Learning à des problèmes concrets, en étroite collaboration avec notre réseau mondial de partenaires de recherche.

Programme de stages pour doctorants

En tant que stagiaire doctorant, vous travaillerez avec une équipe de chercheurs et de scientifiques appliqués expérimentés, relevant des défis inspirés par le déploiement à grande échelle des méthodes d’IA dans l’ensemble et au-delà du vaste portefeuille de logiciels d’entreprise de SAP. Vous aurez l’opportunité de travailler avec certains des ensembles de données les plus riches au monde, afin de résoudre des problèmes qui ont un impact sur nos clients.

Publications

Transformeur relationnel : vers des modèles de fondation zero-shot pour les données relationnelles

Rishabh Ranjan, Valter Hudovernik, Mark Znidar, Charilaos Kanatsoulis, Roshan Upendra, Mahmoud Mohammadi, Joe Meyer, Tom Palczewski, Carlos Guestrin, Jure Leskovec, ICLR, 2026

 

Parler, évaluer, diagnostiquer : évaluation des agents tenant compte des utilisateurs avec analyse automatisée des erreurs

Penny Chong, Harshavardhan Abichandani, Jiyuan SHEN, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier, ICLR, 2026

 

PluRel : les données synthétiques débloquent les lois d'échelle pour les modèles de fondation relationnels

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec, ICML, 2026

 

Le réglage fin centré sur la désambiguïsation rend les LLM d’appel d’outils d’entreprise plus réalistes et moins risqués

Ashutosh Hathidara, Julien Yu, Sebastian Schreiber, ACL Findings, 2026

 

SPRINT : inférence évolutive, sécurisée et à confidentialité différentielle pour les Transformers

Francesco Capano, Jonas Böhler, Benjamin Weggenmann, PETS, 2026

 

Repenser l’ordre de lecture : vers une compréhension généralisable des documents grâce à la modélisation des relations basée sur les LLM.

Weishi Wang, Hengchang Hu, et Daniel Dahlmeier, EACL, 2026

 

SoK : amélioration de l'apprentissage collaboratif cryptographique avec la confidentialité différentielle

Francesco Capano, Jonas Böhler, Benjamin Weggenmann,  IEEE SatML, 2026

 

RecPFN : réseaux ajustés sur des a priori pour des recommandations basées sur le contexte.

En Zhi Tan, Jia Xiang Lim, Bryan Chew, Tze Minh Ng, Benjamin Yap, Volet Articles longs, SIGIR, 2026

 

OCR ou non ? Repenser l’extraction d’informations des documents à l’ère des MLLM avec des jeux de données réels à grande échelle

Jiyuan Shen, Peiyue Yuan, Atin Ghosh, Yifan Mai, Daniel Dahlmeier, Industry Track, EACL, 2026

 

Apprentissage relationnel en contexte sur des données structurées via l’agrégation de voisinage et les informations structurelles

Joseph Meyer, Afreen Shaikh, Mohammadi Reza, Dinesh Katupputhur Ramprasath, Karan Paresh, Roshan Reddy Upendra, Tom Palczewski, Mark Li, Summer Symposium, AAAI, 2026

 

OmniOData : libérer le potentiel des petits modèles de langage pour la génération de requêtes OData avec des données synthétiques et l'apprentissage par renforcement

Tao Bai, Zhaochen Li, Hongxin Shao, Daniel Dahlmeier, Industry Track, ACL, 2026

 

Validation des données à plusieurs niveaux pour les pipelines de construction de graphes de connaissances

Lars Heling, Isaiah Onando Mulang’, Hassan el Hajj, Felix Sasaki, Industry Track, ESWC, 2026

 

MirrorBench : un cadre extensible pour évaluer User-Proxy

Ashutosh Hathidara, Julien Yu, Vaishali, Sebastian Schreiber, Anil Babu Ankisettipalli,  Volet jeux de données & bancs d’essai, KDD, 2026

 

Évaluation unifiée des méthodes de plongement de tables sur plusieurs scénarios de référence

Ali Younes, Saeed Ghoorchian, Maximilian Schambach, Johannes Höhne, atelier DATA-FM, ICLR, 2026

 

Modèle de fondation tabulaire pour la modélisation générative

Xiangjian Jiang, Mingxuan Liu, Nikola Simidjievski, Tassilo Klein, Mateja Jamnik, atelier FMSD, ICML, 2026

 

TableFactory : génération de données tabulaires sémantiquement liées via la simulation comportementale multi-agents

Mingxuan Liu, Xiangjian Jiang, Johannes Hoffart, Tassilo Klein, atelier FMSD, ICML, 2026

Statistiquement indiscernables, opérationnellement distincts : un obstacle formel pour les modèles fondamentaux tabulaires

Tassilo Klein, Johannes Hoffart, atelier FMSD, ICML, 2026

 

Les classements des modèles de fondation tabulaires sont-ils fiables ? Une analyse de RelBench et DBInfer selon la théorie de la généralisabilité

Dinesh Katupputhur Ramprasath, Tom Palczewski, Joe Meyer, Roshan Reddy Upendra, Minghua Li, atelier FMSD, ICML, 2026

 

De PLUREL à RDB-PFN : pré-entraînement relationnel synthétique guidé par le schéma

Mohammad Sadeq Abolhasani, Viswanath Ganapathy, atelier FMSD, ICML, 2026

 

Le pré-entraînement à grande échelle permet la prédiction à partir de peu d’exemples pour les données relationnelles

Rishabh Ranjan, Vignesh Kothapalli, Harshvardhan Agarwal, Charilaos I. Kanatsoulis, Roshan Reddy Upendra, Tom Palczewski, Carlos Guestrin, Jure Leskovec, atelier FMSD, ICML, 2026

 

FlexTab : vers une architecture codeur-décodeur flexible pour l’apprentissage en contexte sur des données tabulaires

Marek Polewczyk, Maximilian Schambach, Marco Spinaci, Sam Thelin, Johannes Höhne, atelier FMSD, ICML, 2026

 

Explorer les différences entre les données tabulaires d'entreprise et les benchmarks publics

Myung Jun Kim, Maximilian Schambach, Frank Essenberger, André Sres, Johannes Höhne, FMSD workshop, ICML, 2026

 

Amélioration des apprenants tabulaires grâce à des représentations sémantiques contextuelles

Günther Schindler, Maximilian Schambach, Johannes Höhne, FMSD workshop, ICML, 2026

 

Évaluation comparative de l’attention pour les modèles de base tabulaires

Maximilian Schambach, Clemens Biehl, Sam Thelin, atelier FMSD, ICML, 2026

 

Sondage de la mémorisation de l’apprentissage en contexte tabulaire

Francesco Capano, Jonas Böhler, atelier FMSD, ICML, 2026

 

Le pré-entraînement à grande échelle permet la prédiction à partir de peu d’exemples pour les données relationnelles

Rishabh Ranjan, Vignesh Kothapalli, Harshvardhan Agarwal, Charilaos I. Kanatsoulis, Roshan Reddy Upendra, Tom Palczewski, Carlos Guestrin, Jure Leskovec, GFM workshop, ICML, 2026

 

Au-delà de la précision sur RelBench : analyse par la théorie de la réponse aux items des benchmarks de Deep Learning relationnel

Dinesh Katupputhur Ramprasath, Tom Palczewski, Joe Meyer, Roshan Reddy Upendra, Minghua Li, atelier GFM, ICML, 2026

 

DIPA : allocation probabiliste du calcul au moment du test, éclairée par la difficulté, via des proxys sans entraînement

Wenyang Hu, Yao Shu, See-Kiong Ng, Bryan Kian Hsiang Low, atelier AdaptFM, ICML, 2026

 

Inciter au partage de modèles boîte noire avec des récompenses et des gains équitables

Wenyang Hu, Xinyi Xu, See-Kiong Ng, Bryan Kian Hsiang Low, AAMAS (Extended Abstract), 2026

 

Représentation des outils agentiques dans les graphes de connaissances pour une découverte d’outils sensible à la structure en situation de surcharge d’outils

Isaiah Onando Mulang', Johannes Thaller, Tushar Trivedi, Lars Heling, Felix Sasaki, atelier GENAIK NORA, IJCAI-ECAI, 2026

 

Extension de vocabulaire économe en paramètres via l’alignement de plongements interlinguistiques

Andrew Ivan Soegeng, Muhammad Reza Qorib, Weishi Wang, Daniel Dahlmeier, Hwee Tou Ng, atelier MeLLM, ACL, 2026

 

Consensus translinguistique : aligner les connaissances culturelles multilingues via l’auto-cohérence multilingue

Andrew Ivan Soegeng, Patrick Sutanto, Nguyen Tan Sang, atelier MeLLM, ACL, 2026

twitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixeltwitter pixel