Passer au contenu principal

Récupérer/lier la Carerix Datasource

Comment vous connecter et récupérer les fichiers de la Carerix Datasource via FTPS ou Amazon S3, pour la Datasource 1.0 comme pour la Datasource 2.0.

Ce document décrit les possibilités de lier ou de récupérer les fichiers de la Carerix Datasource.

Les fichiers de la Datasource sont mis à disposition sur notre serveur FTP et/ou dans un bucket Amazon S3. Les deux canaux peuvent fournir aussi bien la Datasource 1.0 que la Datasource 2.0, selon ce qui est configuré pour votre compte — les étapes de connexion ci-dessous sont identiques dans les deux cas. S3 est fortement recommandé, en particulier pour la Datasource 2.0.

💡 Si vous recevez la Datasource 2.0, les fichiers arrivent sous forme d'archive compressée (.tgz pour Unix/Linux, .zip pour Windows/macOS). Extrayez d'abord l'archive pour accéder aux fichiers CSV individuels — cela s'applique quelle que soit la méthode ci-dessous que vous utilisez.

1. Tester la connexion avec netcat (serveur FTP)

Système d'exploitation : Linux et macOS
Testé sur macOS 15.2

Prérequis : l'adresse IP utilisée pour effectuer le test netcat doit figurer sur notre liste blanche.

Explicit FTPS

% nc -vvv datasource.carerix.net 21Connection to datasource.carerix.net port 21 [tcp/ftp] succeeded!220-FileZilla Server 1.9.3220 Please visit https://filezilla-project.org/

2. Client GUI FileZilla (serveur FTP)

Système d'exploitation : Linux, Windows et macOS
Testé sur macOS 15.2 avec FileZilla Client 3.68.1 Apple Silicon (arm64)

Prérequis :

  • Nom d'utilisateur FTP

  • Mot de passe FTP

  • L'adresse IP utilisée avec le client FileZilla doit figurer sur notre liste blanche

  • En cas d'utilisation d'un pare-feu sortant, les ports TCP 21 et 21000–21010 doivent être autorisés pour l'adresse IP 3.121.45.103

3. Interface en ligne de commande WinSCP (serveur FTP)

Système d'exploitation : Windows
Testé sur Windows 11 avec WinSCP 6.1.1

Prérequis :

  • WinSCP (installation type)

  • Nom d'utilisateur FTP

  • Mot de passe FTP

  • L'adresse IP utilisée avec WinSCP doit figurer sur notre liste blanche

  • En cas d'utilisation d'un pare-feu sortant, les ports TCP 21 et 21000–21010 doivent être autorisés pour l'adresse IP 3.121.45.103

Ouvrez l'invite de commandes (cmd.exe)

"C:\Program Files (x86)\WinSCP\WinSCP.com"winscp> open ftpes://carerix.user1:xxxxxx@datasource.carerix.net:21Connecting to datasource.carerix.net ...
TLS connection established. Waiting for welcome message...
Connected
Starting the session...
Session started.
Active session: [1] xxxxxx.user1@datasource.carerix.netwinscp> ls crmatch*D---------   0                       0          ..
----------   0                   23245 Aug 20  1:22:28 2023 Cragency.csv
...winscp> get crcompany.csv c:\temp\
crcompany.csv         |   36260 KB | 2131.9 KB/s | binary | 100%winscp> exit

En tant que commande dans un fichier batch :

C:\Program Files (x86)\WinSCP\WinSCP.com /command ^
"ftpes://carerix.user1:xxxxxx@datasource.carerix.net:21" ^
"get *.csv c:\temp\" ^
"exit"

4. GUI Cyberduck (bucket S3)

Système d'exploitation : Linux, Windows et macOS
Testé sur macOS 15.2 avec Cyberduck client 9.1.0

Prérequis :

  • Nom du bucket AWS S3 : datasource-nomduclient

  • AWS access key id

  • AWS secret access key

  • Région AWS : eu-central-1 (Francfort)

5. Connecteur Python PowerBI Desktop (bucket S3)

Récupère les données d'un fichier spécifique du bucket S3.

Système d'exploitation : Windows
Testé avec PowerBI Desktop 2.120.731.0 et Python 3.11.4

Prérequis :

  • PowerBI Desktop

  • Python 3, pip et quelques modules Python

  • Nom du bucket AWS S3 : datasource-nomduclient

  • AWS access key id

  • AWS secret access key

  • Région AWS : eu-central-1 (Francfort)

Ouvrez l'invite de commandes (cmd.exe)

# allez dans le dossier où Python est installé
cd C:\Users\xxxxxx\AppData\Local\Programs\Python\Python311# installez le gestionnaire de paquets Python pip
curl https://bootstrap.pypa.io/ez_setup.py | python
curl https://bootstrap.pypa.io/get-pip.py | python# installez les modules Python requis
Scripts\pip.exe install boto3 matplotlib pandas

Ouvrez PowerBI Desktop > Home > Get data > more > Python

⚠️ Votre bucket contient-il des archives Datasource 2.0 ? Extrayez d'abord l'archive — l'exemple ci-dessous suppose qu'un fichier CSV individuel Datasource 1.0 est déjà présent dans le bucket.

Exemple Crcompany.csv

import boto3, os, io
import pandas as pdmy_key = 'xxxxxx'
my_secret = 'xxxxxx'
my_bucket_name = 'datasource-xxxxxx'
my_file = 'Crcompany.csv'session = boto3.Session(aws_access_key_id=my_key, aws_secret_access_key=my_secret)
s3 = session.resource('s3')
bucket = s3.Bucket(my_bucket_name)
bucket.download_file(my_file, my_file)
crcompany = pd.read_csv(my_file, delimiter=',')

💡 La Datasource 1.0 utilise un point-virgule (;) comme séparateur, la Datasource 2.0 une virgule (,) — ajustez le paramètre delimiter selon la version que vous lisez.

6. Interface en ligne de commande AWS (bucket S3)

Système d'exploitation : Linux, Windows et macOS
Testé sur macOS 15.2 avec AWS CLI 2.22.17

Prérequis :

  • Nom du bucket AWS S3 : datasource-nomduclient

  • AWS access key id

  • AWS secret access key

  • Région AWS : eu-central-1 (Francfort)

# exemple macOS$ which aws
/usr/local/bin/aws$ aws --version
aws-cli/2.2.23 Python/3.8.8 Darwin/22.6.0 exe/x86_64 prompt/of# créer un profil par défaut
$ aws configure
AWS Access Key ID [None]: xxxxxx
AWS Secret Access Key [None]: xxxxxx
Default region name [None]: eu-central-1
Default output format [None]: json$ aws s3 ls s3://datasource-nomduclient/2023-08-19 03:32:06   8456 Cragency.csv
2023-08-19 03:32:06   4579 Crarticle.csv
2023-08-19 03:32:06  153351138 Crattachment.csv
2023-08-19 03:32:08  509534996 Crattributechange.csv
...# synchroniser tous les fichiers vers le dossier local /var/tmp
# seuls les fichiers modifiés sont téléchargés ; cela évite des téléchargements inutiles.$ aws s3 sync s3://datasource-nomduclient/ /var/tmp

💡 Avec la Datasource 2.0, la liste ci-dessus affichera des archives .tgz et .zip au lieu de fichiers .csv individuels. Extrayez l'archive après la synchronisation pour accéder aux fichiers CSV qu'elle contient.

Avez-vous trouvé la réponse à votre question ?