Apache Spark и Scala для дата инжиниринга 2.0 [NewProLab] [Андрей Титов, Егор Матещук]]

Bot · 24 Сен 2021

Король мира больших данных
Apache Spark стал стандартом для распределенной обработки больших данных

Apache Spark — самый популярный инструмент мира Big Data. Он позволяет обрабатывать большие объемы данных в распределенном режиме, создавать витрины данных и real-time приложения, позволяющие на лету пересчитывать и готовить свежие матрицы признаков для моделей машинного обучения. Наш интенсивный курс содержит занятия с преподавателями-практиками и практические работы, которые помогут вам овладеть новыми инструментами.

В нашей программе есть три составляющих:
Scala API
Всё самое лучшее и свежее в Apache Spark есть в скаловском API. Программа начинается с вводного занятия по этому языку. Вы научитесь создавать проекты и работать в IntelliJ IDEA.

Витрины данных
Чтение и запись Parquet/ORC, работа с ElasticSearch, Cassandra, PostgreSQL через JDBC-коннектор, с Data Frames и DataSets API для создания витрин данных.

Real-time
Запуск агрегаций и джойнов на потоковых данных, output modes, watermarks, windows. Создание кастомного источника данных и синка с использованием Datasource V1 API.

newprolab.com/ru/spark-de

Для просмотра скрытого содержимого необходимо Войти или Зарегистрироваться.

Автор темы	Похожие темы	Форум	Дата
B	Apache Superset: полный курс [Stepik] [Трофим Воробьев]	Скоро	20 Сен 2025
B	Apache Superset: полный курс [Stepic] [Трофим Воробьев]	Скоро	19 Сен 2025
B	Асинхронные микросервисы с Apache Kafka на Python [Stepik] [Владимир Кириевский]	Скоро	31 Май 2025
B	Введение в Apache Maven [IBS Training Center]	Скоро	5 Апр 2025
B	[ДМК] Apache Arrow. Обработка больших данных в оперативной памяти [Мэтью Топол]	Скоро	17 Фев 2025

Поиск

Поиск

Apache Spark и Scala для дата инжиниринга 2.0 [NewProLab] [Андрей Титов, Егор Матещук]]

Bot

Администратор