Skip to content

Cet article explique comment obtenir le nombre de lignes, de colonnes et le total des รฉlรฉments (taille) dans ๐ฉโ€Œ๐šโ€Œ๐งโ€Œ๐โ€Œ๐šโ€Œ๐ฌโ€Œ.D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ et ๐ฉโ€Œ๐šโ€Œ๐งโ€Œ๐โ€Œ๐šโ€Œ๐ฌโ€Œ.S๐žโ€Œ๐ซโ€Œ๐ขโ€Œ๐žโ€Œ๐ฌโ€Œ .

Contenu

Prenons comme exemple les donnรฉes sur les survivants du Titanic. Elles peuvent รชtre tรฉlรฉchargรฉes depuis Kaggle .

import pandas as pd print(pd.__version__) # 2.0.0 df = pd.read_csv('data/src/titanic_train.csv') print(df.head()) # PassengerId Survived Pclass  # 0 1 0 3 \ # 1 2 1 1  # 2 3 1 3  # 3 4 1 1  # 4 5 0 3  #  # Name Sex Age SibSp  # 0 Braund, Mr. Owen Harris male 22.0 1 \ # 1 Cumings, Mrs. John Bradley (Florence Briggs Th... female 38.0 1  # 2 Heikkinen, Miss. Laina female 26.0 0  # 3 Futrelle, Mrs. Jacques Heath (Lily May Peel) female 35.0 1  # 4 Allen, Mr. William Henry male 35.0 0  #  # Parch Ticket Fare Cabin Embarked  # 0 0 A/5 21171 7.2500 NaN S  # 1 0 PC 17599 71.2833 C85 C  # 2 0 STON/O2. 3101282 7.9250 NaN S  # 3 0 113803 53.1000 C123 S  # 4 0 373450 8.0500 NaN S  

Obtenez le nombre de lignes, de colonnes et d’รฉlรฉments dans ๐ฉโ€Œ๐šโ€Œ๐งโ€Œ๐โ€Œ๐šโ€Œ๐ฌโ€Œ.D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ

Afficher le nombre de lignes, de colonnes, etc. : ๐โ€Œ๐Ÿโ€Œ.๐ขโ€Œ๐งโ€Œ๐Ÿโ€Œ๐จโ€Œ()

La mรฉthode ๐ขโ€Œ๐งโ€Œ๐Ÿโ€Œ๐จโ€Œ() de D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ affiche des informations telles que le nombre de lignes et de colonnes, l’utilisation totale de la mรฉmoire, le type de donnรฉes de chaque colonne et le nombre d’รฉlรฉments non NaN.

df.info() # <class 'pandas.core.frame.DataFrame'> # RangeIndex: 891 entries, 0 to 890 # Data columns (total 12 columns): # # Column Non-Null Count Dtype  # --- ------ -------------- -----  # 0 PassengerId 891 non-null int64  # 1 Survived 891 non-null int64  # 2 Pclass 891 non-null int64  # 3 Name 891 non-null object  # 4 Sex 891 non-null object  # 5 Age 714 non-null float64 # 6 SibSp 891 non-null int64  # 7 Parch 891 non-null int64  # 8 Ticket 891 non-null object  # 9 Fare 891 non-null float64 # 10 Cabin 204 non-null object  # 11 Embarked 889 non-null object  # dtypes: float64(2), int64(5), object(5) # memory usage: 83.7+ KB 

Le rรฉsultat est affichรฉ comme sortie standard ; il ne peut pas รชtre directement affectรฉ ร  une variable ni utilisรฉe dans les calculs.

Obtenez le nombre de lignes et de colonnes : ๐โ€Œ๐Ÿโ€Œ.๐ฌโ€Œ๐กโ€Œ๐šโ€Œ๐ฉโ€Œ๐žโ€Œ

L’attribut ๐ฌโ€Œ๐กโ€Œ๐šโ€Œ๐ฉโ€Œ๐žโ€Œ de D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ stocke le nombre de lignes et de colonnes sous forme de tuple (๐งโ€Œ๐ฎโ€Œ๐ฆโ€Œ๐›โ€Œ๐žโ€Œ๐ซโ€Œ ๐จโ€Œ๐Ÿโ€Œ ๐ซโ€Œ๐จโ€Œ๐ฐโ€Œ๐ฌโ€Œ, ๐งโ€Œ๐ฎโ€Œ๐ฆโ€Œ๐›โ€Œ๐žโ€Œ๐ซโ€Œ (c’est un peu comme si j’รฉtais une femme) .

print(df.shape) # (891, 12) print(df.shape[0]) # 891 print(df.shape[1]) # 12 

Vous pouvez dรฉcompresser le tuple et attribuer les valeurs ร  des variables distinctes.

row, col = df.shape print(row) # 891 print(col) # 12 

Obtenir le nombre de lignes : ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ(๐โ€Œ๐Ÿโ€Œ)

Le nombre de lignes dans D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ peut รชtre obtenu avec la fonction intรฉgrรฉe Python ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ() .

print(len(df)) # 891 

Obtenir le nombre de colonnes : ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ(๐โ€Œ๐Ÿโ€Œ.๐œโ€Œ๐จโ€Œ๐ฅโ€Œ๐ฎโ€Œ๐ฆโ€Œ๐งโ€Œ๐ฌโ€Œ)

Le nombre de colonnes dans D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ peut รชtre obtenu en appliquรฉ ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ() ร  l’attribut ๐œโ€Œ๐จโ€Œ๐ฅโ€Œ๐ฎโ€Œ๐ฆโ€Œ๐งโ€Œ๐ฌโ€Œ .

print(len(df.columns)) # 12 

Obtenez le nombre d’รฉlรฉments : ๐โ€Œ๐Ÿโ€Œ.๐ฌโ€Œ๐ขโ€Œ๐ณโ€Œ๐žโ€Œ

Le nombre total d’รฉlรฉments dans D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ est stockรฉ dans l’attribut ๐ฌโ€Œ๐ขโ€Œ๐ณโ€Œ๐žโ€Œ . Cela รฉquivaut ร  ๐ซโ€Œ๐จโ€Œ๐ฐโ€Œ_๐œโ€Œ๐จโ€Œ๐ฎโ€Œ๐งโ€Œ๐ญโ€Œ * ๐œโ€Œ๐จโ€Œ๐ฅโ€Œ๐ฎโ€Œ๐ฆโ€Œ๐งโ€Œ_๐œโ€Œ๐จโ€Œ๐ฎโ€Œ๐งโ€Œ๐ญโ€Œ .

print(df.size) # 10692 print(df.shape[0] * df.shape[1]) # 10692 

Remarques lors de la dรฉfinition d’un index

Lorsque vous utilisez la mรฉthode ๐ฌโ€Œ๐žโ€Œ๐ญโ€Œ_๐ขโ€Œ๐งโ€Œ๐โ€Œ๐žโ€Œ๐ฑโ€Œ() pour dรฉfinir des colonnes de donnรฉes en tant qu’index, ces colonnes sont supprimรฉes du corps de donnรฉes principal (l’attribut ๐ฏโ€Œ๐šโ€Œ๐ฅโ€Œ๐ฎโ€Œ๐žโ€Œ๐ฌโ€Œ ). Par consรฉquent, elles ne sont plus incluses dans le nombre total de colonnes.

df_multiindex = df.set_index(['Sex', 'Pclass', 'Embarked', 'PassengerId']) print(df_multiindex.shape) # (891, 8) print(len(df_multiindex)) # 891 print(len(df_multiindex.columns)) # 8 print(df_multiindex.size) # 7128 

Consultez l’article suivant pour ๐ฌโ€Œ๐žโ€Œ๐ญโ€Œ_๐ขโ€Œ๐งโ€Œ๐โ€Œ๐žโ€Œ๐ฑโ€Œ() .

Obtenez le nombre d’รฉlรฉments dans ๐ฉโ€Œ๐šโ€Œ๐งโ€Œ๐โ€Œ๐šโ€Œ๐ฌโ€Œ.S๐žโ€Œ๐ซโ€Œ๐ขโ€Œ๐žโ€Œ๐ฌโ€Œ

Pour un exemple S๐žโ€Œ๐ซโ€Œ๐ขโ€Œ๐žโ€Œ๐ฌโ€Œ , sรฉlectionnez une colonne dans un D๐šโ€Œ๐ญโ€Œ๐šโ€ŒF๐ซโ€Œ๐šโ€Œ๐ฆโ€Œ๐žโ€Œ .

s = df['PassengerId'] print(s.head()) # 0 1 # 1 2 # 2 3 # 3 4 # 4 5 # Name: PassengerId, dtype: int64 

Obtenez le nombre d’รฉlรฉments : ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ(๐ฌโ€Œ) , ๐ฌโ€Œ.๐ฌโ€Œ๐ขโ€Œ๐ณโ€Œ๐žโ€Œ

ร‰tant donnรฉ que S๐žโ€Œ๐ซโ€Œ๐ขโ€Œ๐žโ€Œ๐ฌโ€Œ est unidimensionnel, vous pouvez obtenir le nombre total d’รฉlรฉments (taille) en utilisant soit ๐ฅโ€Œ๐žโ€Œ๐งโ€Œ() , soit les attributs ๐ฌโ€Œ๐ขโ€Œ๐ณโ€Œ๐žโ€Œ et ๐ฌโ€Œ๐กโ€Œ๐šโ€Œ๐ฉโ€Œ๐žโ€Œ . Notez que l’attribut ๐ฌโ€Œ๐กโ€Œ๐šโ€Œ๐ฉโ€Œ๐žโ€Œ est un tuple avec un รฉlรฉment.

print(len(s)) # 891 print(s.size) # 891 print(s.shape) # (891,) print(type(s.shape)) # <class 'tuple'> 

La mรฉthode ๐ขโ€Œ๐งโ€Œ๐Ÿโ€Œ๐จโ€Œ() a รฉgalement รฉtรฉ ajoutรฉe ร  S๐žโ€Œ๐ซโ€Œ๐ขโ€Œ๐žโ€Œ๐ฌโ€Œ dans pandas 1.4.

s.info() # <class 'pandas.core.series.Series'> # RangeIndex: 891 entries, 0 to 890 # Series name: PassengerId # Non-Null Count Dtype # -------------- ----- # 891 non-null int64 # dtypes: int64(1) # memory usage: 7.1 KB