Как экспортировать Pandas DataFrame в CSV (с примером)
Вы можете использовать следующий синтаксис для экспорта кадра данных pandas в файл CSV:
df.to_csv (r' C:\Users\Bob\Desktop\my_data.csv', index= False )
Обратите внимание, что index=False указывает Python удалить столбец индекса при экспорте DataFrame. Не стесняйтесь отбрасывать этот аргумент, если вы хотите сохранить столбец индекса.
В следующем пошаговом примере показано, как использовать эту функцию на практике.
Шаг 1: Создайте фрейм данных Pandas
Во-первых, давайте создадим DataFrame pandas:
import pandas as pd #create DataFrame df = pd.DataFrame() #view DataFrame df points assists rebounds 0 25 5 11 1 12 7 8 2 15 7 10 3 14 9 6 4 19 12 6 5 23 9 5
Шаг 2: Экспортируйте DataFrame в файл CSV
Далее экспортируем DataFrame в файл CSV:
#export DataFrame to CSV file df.to_csv (r' C:\Users\Bob\Desktop\my_data.csv', index= False )
Шаг 3. Просмотрите CSV-файл
Наконец, мы можем перейти к месту, куда мы экспортировали CSV-файл, и просмотреть его:
points,assists,rebounds 25,5,11 12,7,8 15,7,10 14,9,6 19,12,6 23,9,5
Обратите внимание, что индексного столбца нет в файле, поскольку мы указали index=False .
Также обратите внимание, что заголовки находятся в файле, поскольку аргументом по умолчанию в функции to_csv() является headers=True .
Ради интереса, вот как выглядел бы CSV-файл, если бы мы не указали аргумент index=False :
,points,assists,rebounds 0,25,5,11 1,12,7,8 2,15,7,10 3,14,9,6 4,19,12,6 5,23,9,5
Подробное руководство по функции to_csv() см.в документации pandas .
Как скачать таблицу из юпитер ноутбука?
Предположим, что у меня есть таблица в формате dataframe, я преобразую её в формат csv, используя to_csv, как теперь мне скачать эту таблицу?
Отслеживать
задан 15 авг 2021 в 16:57
67 1 1 серебряный знак 5 5 бронзовых знаков
1 ответ 1
Сортировка: Сброс на вариант по умолчанию
Разберем на примере кода:
import pandas as pd cities = pd.DataFrame([['Sacramento', 'California'], ['Miami', 'Florida']], columns=['City', 'State']) cities.to_csv('cities.csv')
В строке cities.to_csv(‘cities.csv’) вы конвертирует DataFrame-файл и записываете в файл ‘cities.csv’, также можно указать прямой путь к файлу. Далее он сохраняется в рабочем каталоге запущенного файла. Следовательно, вам не надо будет скачивать сам конвертированный файл,он будет в той же директории, где находится ваш py-файл с кодом выше(если брать пример выше).
Как загружать в Юпитер.Ноутбук файл данных с локального диска Windows

Обучаясь на платформе Яндекс.Практикум, часто сталкивался с тем, что на сайте проводятся работы по улучшению сервиса.
Поэтому проекты стал делать в локальной версии Юпитер.Ноутбука.
У меня ноутбук на Windows.
В блоке чтения файла применяю конструкцию try: exceprt:
Эта конструкция сама выбирает доступный источник данных.
Блок кода для загрузки файла из-под Windows:
import pandas as pd try: data = pd.read_csv('/datasets/real_estate_data.csv', sep='\t') # Yandex path except: # синтаксис указания пути для Windows data = pd.read_csv(r"C:\Users\eddyd\Downloads\Praktikum\Datas_Thried_Project\real_estate_data.csv", sep='\t') # personal path
Руководство по Загрузка данных и выполнение запросов в кластере Apache Spark в Azure HDInsight
В этом руководстве описывается, как создать кадр данных из CSV-файла и как отправлять интерактивные запросы SQL Spark к кластеру Apache Spark в Azure HDInsight. В Spark кадр данных — это распределенная коллекция данных, упорядоченных в именованных столбцах. Она эквивалентна таблице в реляционной базе данных или фрейме данных в R/Python.
В этом руководстве описано следующее:
- Создание кадра данных из CSV-файла
- Выполнение запросов к кадру данных
Предварительные требования
Создание записной книжки Jupyter
Jupyter Notebook — это интерактивная среда Notebook, которая поддерживает различные языки программирования. Notebook позволяет работать с данными, объединять код с текстом Markdown и выполнять простые визуализации.

- Измените URL-адрес https://SPARKCLUSTER.azurehdinsight.net/jupyter , заменив SPARKCLUSTER именем кластера Spark. В веб-браузере введите измененный URL-адрес. При появлении запроса введите учетные данные для входа в кластер.
- На веб-странице Jupyter для кластеров Spark 2.4, выберите New (Создать)>PySpark, чтобы создать записную книжку. Для выпуска Spark 3.1 вместо этого выберите New (Создать)>PySpark3, чтобы создать записную книжку, поскольку ядро PySpark больше не доступно в Spark 3.1. Будет создана и открыта записная книжка с именем Untitled( Untitled.ipynb ).
Примечание Если записная книжка создается с использованием PySpark или ядра PySpark3, сеанс spark автоматически создается при выполнении первой ячейки кода. Вам не нужно явно создавать этот сеанс.
Создание кадра данных из CSV-файла
Приложения могут создавать кадры данных непосредственно из файлов или папок в удаленном хранилище, например в службе хранилища Azure или Azure Data Lake Storage, из таблицы Hive или из других источников данных, поддерживаемых Spark, таких как Azure Cosmos DB, Azure SQL DB, DW и т. д. На снимке экрана показан моментальный снимок файла hvac.csv, используемого в этом руководстве. CSV-файл содержит все кластеры HDInsight Spark. Эти данные демонстрируют колебания температуры в некоторых зданиях.

-
Вставьте следующий код в пустую ячейку записной книжки Jupyter Notebook и нажмите SHIFT+ВВОД для выполнения кода. Код импортирует типы, необходимые для этого сценария:
from pyspark.sql import * from pyspark.sql.types import *

При запуске интерактивного запроса в Jupyter в заголовке окна веб-браузера или вкладки будет отображаться состояние (Busy) (Занято), а также название приложения. Кроме того, рядом с надписью PySpark в верхнем правом углу окна будет показан закрашенный кружок. После завершения задания он изменится на кружок без заливки.
# Create a dataframe and table from sample data csvFile = spark.read.csv('/HdiSamples/HdiSamples/SensorSampleData/hvac/HVAC.csv', header=True, inferSchema=True) csvFile.write.saveAsTable("hvac")
Выполнение запросов к кадру данных
Когда таблица будет готова, выполните интерактивный запрос к данным.
-
В пустой ячейке приложения выполните следующий код:
%%sql SELECT buildingID, (targettemp - actualtemp) AS temp_diff, date FROM hvac WHERE date = \"6/1/13\"
Отобразятся следующие табличные данные. 

Очистка ресурсов
С HDInsight ваши данные и записные книжки Jupyter Notebook сохраняются в Службе хранилища Azure или Azure Data Lake Storage, что позволяет безопасно удалить неиспользуемый кластер. Плата за кластеры HDInsight взимается, даже когда они не используются. Так как затраты на кластер во много раз превышают затраты на хранилище, экономически целесообразно удалять неиспользуемые кластеры. Если вы планируете сразу приступить к следующему руководству, можно оставить кластер.
Откройте кластер на портале Azure и выберите Удалить.

Кроме того, можно выбрать имя группы ресурсов, чтобы открыть страницу группы ресурсов, а затем щелкнуть Удалить группу ресурсов. Вместе с группой ресурсов вы также удалите кластер Spark в HDInsight и учетную запись хранения по умолчанию.
Дальнейшие действия
В этом учебнике описывается, как создать кадр данных из CSV-файла и как отправлять интерактивные запросы SQL Spark к кластеру Apache Spark в Azure HDInsight. Теперь переходите к следующей статье, в которой объясняется, как перенести зарегистрированные в Apache Spark данные в средство бизнес-аналитики, например в Power BI.
