スキップしてメイン コンテンツに移動

Trino概要とOTF対応のコネクタ (#11,12)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。

#11と#12ではStarburst の 蛯原 裕弥 さんをゲストに、Trinoの成り立ちやフェデレーション機能、TrinoコネクタのIceberg, Delta lake対応についてお話をうかがいました。


guest: @ebyhr (蛯原 裕弥)

Starburst Engineer / Trino, Apache Polaris committer


host: @simosako (下佐粉 昭)

AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。


※感想は #OTFTalk でポストいただけると励みになります。

※発言は各個人のものであり、所属組織を代表するものではありません。


第11回:Trinoの成り立ちとコネクタの役割


OTF Talk 第11回は、Starburst の 蛯原 裕弥 さんに、OTFのデータをクエリする際によく利用されている分散SQLエンジンであるPresto/Trinoの成り立ちや、Trinoのフェデレーション機能と各種コネクタについてお話をうかがいました。

PrestoとTrinoの成り立ち/Trinoの特徴/フェデレーション機能とコネクタ/実装はどこが担うのか

https://podcasters.spotify.com/pod/show/otftalk/episodes/11-Trino-e2p8r58/a-abiia6n

https://youtu.be/vvfo60ZCq1M?si=OfG9ZXSVRqMgN08q

※感想は #OTFTalk でポストいただけると励みになります。

※発言は各個人のものであり、所属組織を代表するものではありません。


第12回:Trinoコネクタからみた OTF (Iceberg, Delta lake)

OTF Talk 第12回は、Starburst の 蛯原 裕弥 さんに、OTF(Iceberg, Delta lake)をサポートするTrinoのコネクタについて、概要やその実装方法についてお話をうかがいました。


Trinoコネクタの役割/Icebergコネクタ/Trino+コネクタの特徴/Delta lakeコネクタ/Delta kernelを使っていない理由

https://podcasters.spotify.com/pod/show/otftalk/episodes/12-Trino-OTF-Iceberg--Delta-lake-e2p8r68/a-abiia8d

https://youtu.be/k6SKMwLkmZI?si=FBgvfLkN7EWc23Jx


参考文献)


Starburst

https://www.starburst.io/


Apache Polaris

https://polaris.apache.org/


Presto

https://prestodb.github.io/


Trino

https://trino.io/


Write-Audit-Publish (WAP)解説 (Tabular)

https://www.tabular.io/apache-iceberg-cookbook/data-engineering-write-audit-publish/


蛯原さんのWrite-Audit-Publish (WAP)の実装のための活動(pull request)

https://github.com/trinodb/trino/pull/23513


誤った統計情報を読み取った場合の挙動についてのpull request

https://github.com/apache/iceberg/pull/8559


Delta kernel

https://delta.io/blog/delta-kernel/


コメント

このブログの人気の投稿

OTF (Open Table Format)入門 (#01~#03)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。 この#01~#03では、AWSの疋田さんをゲストに、OTF (Open Table Format) 入門と題して3回にわたってお話を伺いました。 #01 OTF (Open Table Format)入門 - OTF誕生の背景  (youtubeは こちら ) #02  OTF (Open Table Format)入門 - OTFの今 (youtubeは こちら ) #03 OTF (Open Table Format)入門 - OTFのこれから  (youtubeは こちら ) guest: @_Bassari (疋田 宗太郎/べりんぐ) AWSで金融のお客様を担当するソリューションアーキテクト。余暇はOTF/Iceberg関連の技術を探求中。 host: @simosako (下佐粉 昭) AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 参考文献) ■全般 べりんぐさんブログでのOTFへの全般的な解説 https://bering.hatenadiary.com/entry/2023/07/17/235246 Iceberg, Hudi, Delta Lakeの比較記事 ※記事はDremio社によるものです。DremioはIcebergにコミットしている企業である事に留意してください。 https://www.dremio.com/blog/comparison-of-data-lake-table-formats-apache-iceberg-apache-hudi-and-delta-lake/ ■ Apache Iceberg ホームページ https://iceberg.apache.org/ べりんぐさんブログでのIcebergの解説 https://bering.hatenadiary.com/entry/2023/09/24/175953 Iceberg: a fast table...

Open Table Format (OTF) のユースケース (#6, #7)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。この#6~#7では、AWS Glue プロダクトチームの関山 宜孝さんをゲストにOpen Table Format (OTF) のユースケースについてお話を伺いました。 ※今回録音環境に問題があったため、ゲストの声が聴きづらくなっています。 ゲスト: Noritaka Sekiyama ( @moomindani ) AWS Glue product team 所属の Principal Big Data Architect host:  @simosako  (下佐粉 昭) AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 第6回:OTFのユースケース:CDCによるニアリアルタイムデータ連携 OTF Talk 第6回は、AWS Glue プロダクトチームの関山 宜孝さんをゲストに、OTFのユースケースの1つであるCDC (Change Data Capture)の活用についてお話をうかがいました。 ※今回録音環境に問題があったため、ゲストの声が聴きづらくなっています。 OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。 RDBをリアルタイムにdata lakeに連携したい/CDC (Change Data Capture)/なぜ実現困難だったのか/Upsertとトランザクション/データレイクをデータソースにする https://podcasters.spotify.com/pod/show/otftalk/episodes/06-CDC-e2ntfg8/a-abgp2pr https://youtu.be/rc-DmRLeEFU?si=rPakLaQpNIdwEeU0 第7回:OTFのユースケース:個人情報保護のためのデータ削除 OTF Talk 第7回は、AWS Glue プロダクトチームの関山 宜孝さんをゲストに、OTFのユー...

Iceberg へのコントリビューション/Delta Lake UniForm (#4, #5)

OTF Talk は、OTF = Open Table Format の技術的な解説や最新トピック等を、ゲストをむかえてお話をうかがうPodcastです。この#4~#5ではAWSの田中 智大 (tomtan) さんをゲストにお話を伺いました。 guest: Tomohiro Tanaka   AWSのシニア・クラウドサポートエンジニア(Bigdata profile) host: @simosako (下佐粉 昭) AWSのソリューションアーキテクト。 専門はデータレイク 、データウェアハウス。 ※感想は #OTFTalk でポストいただけると励みになります。 ※発言は各個人のものであり、所属組織を代表するものではありません。 #04 Apache Iceberg へのコントリビューション OTF Talk 第4回は、AWSの田中 智大 (tomtan) さんをゲストに、Apache Iceberg へのコントリビューションの経験や、Icebergコミュニティについてお話を伺いました。 Apache Iceberg との出会い/はじめてのコントリビューション/どうすれば貢献できる?/Good first issue/Iceberg コミュニティ https://podcasters.spotify.com/pod/show/otftalk/episodes/04-Apache-Iceberg-e2n9ljk https://youtu.be/wxn9YPdZyrI #05 Delta Lake UniForm (Universal Format) OTF Talk 第5回は、AWSの田中 智大(tomtan) さんをゲストに Delta Lake UniForm  (Universal Format) についてと、カンファレンスに登壇する意義についてお話を伺いました。 Data + AI Summit で登壇/UniForm (Universal Format)ってなに?/UniFormの仕組みと、活用領域/ カンファレンスに登壇するモチベーション/物理的に会ったあとに何が変わったか https://podcasters.spotify.com/pod/show/otftalk/episodes/05-Delta-Lake-UniFor...