Dieses Dokument beschreibt die Möglichkeiten, die Carerix Datasource-Dateien zu verknüpfen oder abzurufen.
Die Datasource-Dateien werden auf unserem FTP-Server und/oder in einem Amazon S3-Bucket bereitgestellt. Beide Kanäle können sowohl Datasource 1.0 als auch Datasource 2.0 liefern, je nachdem, was für Ihr Konto eingerichtet ist — die Verbindungsschritte unten sind in beiden Fällen gleich. S3 wird dringend empfohlen, insbesondere für Datasource 2.0.
💡 Erhalten Sie Datasource 2.0? Dann kommen die Dateien als komprimiertes Archiv an (.tgz für Unix/Linux, .zip für Windows/macOS). Entpacken Sie das Archiv zuerst, um an die einzelnen CSV-Dateien zu gelangen — dies gilt unabhängig davon, welche Methode unten Sie verwenden.
1. Verbindung mit netcat testen (FTP-Server)
1. Verbindung mit netcat testen (FTP-Server)
Betriebssystem: Linux und macOS
Getestet auf macOS 15.2
Voraussetzung: Die IP-Adresse, von der aus der netcat-Test durchgeführt wird, muss auf unserer Whitelist stehen.
Explicit FTPS
% nc -vvv datasource.carerix.net 21Connection to datasource.carerix.net port 21 [tcp/ftp] succeeded!220-FileZilla Server 1.9.3220 Please visit https://filezilla-project.org/
2. FileZilla Client GUI (FTP-Server)
2. FileZilla Client GUI (FTP-Server)
Betriebssystem: Linux, Windows und macOS
Getestet auf macOS 15.2 mit FileZilla Client 3.68.1 Apple Silicon (arm64)
Voraussetzungen:
FTP-Benutzername
FTP-Passwort
Die IP-Adresse, von der aus der FileZilla Client verwendet wird, muss auf unserer Whitelist stehen
Bei Verwendung einer ausgehenden Firewall müssen für IP-Adresse 3.121.45.103 die TCP-Ports 21 und 21000–21010 zugelassen sein
3. WinSCP Client Kommandozeile (FTP-Server)
3. WinSCP Client Kommandozeile (FTP-Server)
Betriebssystem: Windows
Getestet auf Windows 11 mit WinSCP 6.1.1
Voraussetzungen:
WinSCP (Standardinstallation)
FTP-Benutzername
FTP-Passwort
Die IP-Adresse, von der aus WinSCP verwendet wird, muss auf unserer Whitelist stehen
Bei Verwendung einer ausgehenden Firewall müssen für IP-Adresse 3.121.45.103 die TCP-Ports 21 und 21000–21010 zugelassen sein
Öffnen Sie die Eingabeaufforderung (cmd.exe)
"C:\Program Files (x86)\WinSCP\WinSCP.com"winscp> open ftpes://carerix.user1:xxxxxx@datasource.carerix.net:21Connecting to datasource.carerix.net ... TLS connection established. Waiting for welcome message... Connected Starting the session... Session started. Active session: [1] xxxxxx.user1@datasource.carerix.netwinscp> ls crmatch*D--------- 0 0 .. ---------- 0 23245 Aug 20 1:22:28 2023 Cragency.csv ...winscp> get crcompany.csv c:\temp\ crcompany.csv | 36260 KB | 2131.9 KB/s | binary | 100%winscp> exit
Als Befehl in einer Batch-Datei:
C:\Program Files (x86)\WinSCP\WinSCP.com /command ^ "ftpes://carerix.user1:xxxxxx@datasource.carerix.net:21" ^ "get *.csv c:\temp\" ^ "exit"
4. Cyberduck GUI (S3-Bucket)
4. Cyberduck GUI (S3-Bucket)
Betriebssystem: Linux, Windows und macOS
Getestet auf macOS 15.2 mit Cyberduck Client 9.1.0
Voraussetzungen:
AWS S3-Bucket-Name: datasource-kundenname
AWS Access Key ID
AWS Secret Access Key
AWS-Region: eu-central-1 (Frankfurt)
5. PowerBI Desktop Python-Connector (S3-Bucket)
5. PowerBI Desktop Python-Connector (S3-Bucket)
Ruft die Daten einer bestimmten S3-Bucket-Datei ab.
Betriebssystem: Windows
Getestet mit PowerBI Desktop 2.120.731.0 und Python 3.11.4
Voraussetzungen:
PowerBI Desktop
Python 3, pip und einige Python-Module
AWS S3-Bucket-Name: datasource-kundenname
AWS Access Key ID
AWS Secret Access Key
AWS-Region: eu-central-1 (Frankfurt)
Öffnen Sie die Eingabeaufforderung (cmd.exe)
# zum Ordner wechseln, in dem Python installiert ist cd C:\Users\xxxxxx\AppData\Local\Programs\Python\Python311# Python-Paketmanager pip installieren curl https://bootstrap.pypa.io/ez_setup.py | python curl https://bootstrap.pypa.io/get-pip.py | python# benötigte Python-Module installieren Scripts\pip.exe install boto3 matplotlib pandas
PowerBI Desktop öffnen > Home > Get data > more > Python
⚠️ Enthält Ihr Bucket Datasource 2.0-Archive? Entpacken Sie das Archiv zuerst — das folgende Beispiel geht davon aus, dass bereits eine einzelne Datasource 1.0 CSV-Datei im Bucket vorhanden ist.
Crcompany.csv Beispiel
import boto3, os, io
import pandas as pdmy_key = 'xxxxxx'
my_secret = 'xxxxxx'
my_bucket_name = 'datasource-xxxxxx'
my_file = 'Crcompany.csv'session = boto3.Session(aws_access_key_id=my_key, aws_secret_access_key=my_secret)
s3 = session.resource('s3')
bucket = s3.Bucket(my_bucket_name)
bucket.download_file(my_file, my_file)
crcompany = pd.read_csv(my_file, delimiter=',')
💡 Datasource 1.0 verwendet ein Semikolon (;) als Trennzeichen, Datasource 2.0 ein Komma (,) — passen Sie den Parameter delimiter an die Version an, die Sie einlesen.
6. AWS Command Line Interface (S3-Bucket)
6. AWS Command Line Interface (S3-Bucket)
Betriebssystem: Linux, Windows und macOS
Getestet auf macOS 15.2 mit AWS CLI 2.22.17
Voraussetzungen:
AWS S3-Bucket-Name: datasource-kundenname
AWS Access Key ID
AWS Secret Access Key
AWS-Region: eu-central-1 (Frankfurt)
# macOS-Beispiel$ which aws /usr/local/bin/aws$ aws --version aws-cli/2.2.23 Python/3.8.8 Darwin/22.6.0 exe/x86_64 prompt/of# Standardprofil erstellen $ aws configure AWS Access Key ID [None]: xxxxxx AWS Secret Access Key [None]: xxxxxx Default region name [None]: eu-central-1 Default output format [None]: json$ aws s3 ls s3://datasource-kundenname/2023-08-19 03:32:06 8456 Cragency.csv 2023-08-19 03:32:06 4579 Crarticle.csv 2023-08-19 03:32:06 153351138 Crattachment.csv 2023-08-19 03:32:08 509534996 Crattributechange.csv ...# alle Dateien in den lokalen Ordner /var/tmp synchronisieren # Es werden nur geänderte Dateien heruntergeladen; das verhindert unnötige Downloads.$ aws s3 sync s3://datasource-kundenname/ /var/tmp
💡 Bei Datasource 2.0 zeigt die obige Auflistung .tgz- und .zip-Archive statt einzelner .csv-Dateien. Entpacken Sie das Archiv nach der Synchronisierung, um an die CSV-Dateien zu gelangen.
