Databricks Databricks-Certified-Data-Engineer-Professional日本語 Exam Overview:
| Certification Vendor: | Databricks |
| Exam Name: | Databricks Certified Data Engineer Professional Exam |
| Exam Number: | Databricks-Certified-Data-Engineer-Professional |
| Passing Score: | 70% |
| Certificate Validity Period: | 2 years |
| Real Exam Qty: | 45-60 |
| Available Languages: | English |
| Exam Duration: | 120 minutes |
| Exam Price: | $200 USD |
| Related Certifications: | Databricks Certified Data Engineer Associate |
| Exam Format: | Multiple choice, Multiple select, Scenario-based questions, Proctored online exam |
| Recommended Training: | Delta Lake Fundamentals Databricks Data Engineer Learning Path |
| Exam Registration: | Databricks Certification Portal Databricks Academy |
| Sample Questions: | Databricks Databricks-Certified-Data-Engineer-Professional日本語 Sample Questions |
| Exam Way: | Online proctored exam via Databricks certification platform |
| Pre Condition: | Recommended: Databricks Certified Data Engineer Associate or equivalent hands-on experience with Spark and Delta Lake |
| Official Syllabus URL: | https://www.databricks.com/learn/certification/data-engineer-professional |
Databricks Databricks-Certified-Data-Engineer-Professional日本語 Exam Syllabus Topics:
| Section | Objectives |
|---|---|
| Topic 1: Data Modeling and Transformation | - Dimensional modeling concepts - Performance optimization techniques - Spark SQL transformations |
| Topic 2: Databricks Lakehouse Platform Architecture | - Medallion architecture (Bronze, Silver, Gold) - Data governance concepts (Unity Catalog basics) - Workspace and cluster architecture |
| Topic 3: Data Ingestion and Processing | - Batch and streaming ingestion with Auto Loader - ETL pipeline design patterns - Structured Streaming fundamentals |
| Topic 4: Production Pipelines and Orchestration | - Error handling and recovery strategies - Databricks Workflows - Job scheduling and monitoring |
| Topic 5: Delta Lake and Data Management | - Time travel and versioning - Delta Lake transactions and ACID properties - Schema evolution and enforcement |
Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) Sample Questions:
1. データ エンジニアリング チームは、Databricks Lakehouse Monitoring を使用して、Delta テーブル内の重要な列の percent_null メトリックを追跡します。
プロファイル メトリック テーブル (prod_catalog.prod_schema.customer_data_profile_metrics) には、1 時間ごとの percent_null 値が格納されます。
チームの目標:
percent_nullの1日平均が5%を超えるとアラートを発動します。
3日連続。
問題が継続している間は通知がスパムにならないようにします。
A) percent_null を選択
prod_catalog.prod_schema.customer_data_profile_metrics から
window.end >= CURRENT_TIMESTAMP - INTERVAL '1' DAY
アラート条件: percent_null > 5
通知頻度: 最大24時間ごと
B) AVG(percent_null) を daily_avg として選択する
prod_catalog.prod_schema.customer_data_profile_metrics から
window.end >= CURRENT_TIMESTAMP - INTERVAL '3' DAY
アラート条件: daily_avg > 5
通知頻度: アラートが評価されるたびに
C) daily_avg を (
SELECT DATE_TRUNC('DAY', window.end) AS day,
AVG(percent_null) AS avg_null
prod_catalog.prod_schema.customer_data_profile_metrics から
GROUP BY DATE_TRUNC('DAY', window.end)
)
SELECT day, avg_null
daily_avgから
日付順(降順)
制限3
アラート条件: 最新の 3 行の avg_null がすべて 5 より大きい
通知頻度: 1回のみ
D) SELECT SUM(CASE WHEN percent_null > 5 THEN 1 ELSE 0 END) AS violation_days FROM prod_catalog.prod_schema.customer_data_profile_metrics WHERE window.end >= CURRENT_TIMESTAMP - INTERVAL '3' DAY アラート条件: violation_days >= 3 通知頻度: 1 回のみ
2. ジュニア データ エンジニアが、Databricks ジョブ UI を使用して一連のジョブを手動で構成しました。
エンジニアは自分の作業を確認すると、自分が各ジョブの「オーナー」としてリストされていることに気づきます。
「所有者」権限を「DevOps」グループに移管しようとしましたが、このタスクを正常に完了できません。
この権限の譲渡を妨げている原因を説明している記述はどれですか?
A) Databricks ジョブの作成者は常に「所有者」権限を持ちます。この構成は変更できません。
B) Databricks ジョブには所有者が 1 人だけ必要です。「所有者」権限をグループに割り当てることはできません。
C) デフォルトの「admins」グループ以外では、個々のユーザーにのみジョブに対する権限を付与できます。
D) ワークスペース管理者のみがグループに「所有者」権限を付与できます。
E) ユーザーは、そのグループのメンバーである場合にのみ、ジョブの所有権をグループに譲渡できます。
3. テーブルは次のコードで登録されます。
users と orders はどちらも Delta Lake テーブルです。recent_orders をクエリした結果を説明するステートメントはどれですか。
A) すべてのロジックはクエリ時に実行され、クエリの終了時にソース テーブルの有効なバージョンを結合した結果が返されます。
B) 各ソース テーブルのバージョンはテーブル トランザクション ログに保存され、クエリ結果はクエリごとに DBFS に保存されます。
C) テーブルが定義されると結果が計算され、キャッシュされます。これらのキャッシュされた結果は、新しいレコードがソース テーブルに挿入されるたびに増分更新されます。
D) すべてのロジックはクエリ時に実行され、クエリの開始時点のソース テーブルの有効なバージョンを結合した結果が返されます。
E) テーブルが定義されるとすべてのロジックが実行され、テーブルの結合結果が DBFS に保存されます。この保存されたデータは、テーブルがクエリされたときに返されます。
4. 次のエラー トレースバックを確認します。
発生したエラーについて説明している文はどれですか?
A) テーブルにheartrateheartrateheartrateという名前の列はありません
B) 心拍数列が列として正しく識別されていないため、構文エラーがあります。
C) 列オブジェクトは乗算できないため、型エラーが発生します。
D) 実行されたコードは PvSoark ですが、Scala ノートブックで実行されました。
E) DataFrame オブジェクトは乗算できないため、型エラーが発生します。
5. 次のコードは、従来のワークロードから Databricks ノートブックに移行されています。
コードは正常に実行され、論理的に正しい結果を提供しますが、
約 1 GB のデータを抽出してロードするのに 20 分かかります。
この動作を説明できる可能性のある記述はどれですか?
A) クローンを作成する代わりに、コードでは %sh pip install を使用して、クラスター内のすべてのノードで Python コードを並列に実行できるようにする必要があります。
B) %sh は、Git の収集とインストールのためにクラスターの再起動をトリガーします。遅延の大部分はクラスターの起動時間に関連します。
C) %sh はドライバーノード上でシェルコードを実行します。このコードはワーカーノードや Databricks に最適化された Spark を利用しません。
D) %sh はファイル移動操作を分散しません。代わりに %fs を使用するようにコードの最終行を更新する必要があります。
E) DatabricksではPythonの実行速度は常にScalaよりも遅くなります。run.pyスクリプトをScalaにリファクタリングする必要があります。
Solutions:
| Question # 1 Answer: C | Question # 2 Answer: B | Question # 3 Answer: E | Question # 4 Answer: A | Question # 5 Answer: C |

We're so confident of our products that we provide no hassle product exchange.


By Louis


