Databricks Databricks-Certified-Data-Engineer-Professional日本語 考試概覽:
| 認證廠商: | Databricks |
|---|---|
| 考試名稱: | Databricks 專業級資料工程師認證考試 |
| 考試代碼: | Databricks-Certified-Data-Engineer-Professional |
| 支援語言: | English |
| 考試時間: | 120 分鐘 |
| 考試形式: | 單選題, 複選題 |
| 實際考試題數: | 60 |
| 證照有效期限: | 2 年 |
| 及格分數: | 70 |
| 考試費用: | 200 美元 |
| 相關認證: | Databricks Certified Data Engineer Associate |
| 範例考題: | Databricks Databricks-Certified-Data-Engineer-Professional日本語 範例考題 |
| 考試方式: | 線上監考測驗 |
| 必備條件: | 持有 Databricks Certified Data Engineer Associate 認證 |
| 官方大綱網址: | https://www.databricks.com/learn/certification/data-engineer-professional |
Databricks Databricks-Certified-Data-Engineer-Professional日本語 考試大綱主題:
| 章節 | 權重 | 目標 |
|---|---|---|
| 資料建模與儲存 | 20% | - 儲存最佳化 - 檔案格式 - 資料建模 |
| 監控與問題排除 | 16% | - 監控作業 - 問題排除 - 效能最佳化 |
| 資料處理 | 28% | - Spark SQL - Structured Streaming - 資料轉換 - ETL 管線 |
| Databricks Lakehouse 平台 | 24% | - 資料管理 - Lakehouse 架構 - Unity Catalog - Delta Lake |
| 資料品質與治理 | 12% | - 資料歷程追蹤 - 資料品質 - 治理作業 |
最新的 Databricks Certification Databricks-Certified-Data-Engineer-Professional-JPN 免費考試真題:
問題 #1
本番環境にデプロイされた構造化ストリーミングジョブにより、クラウドストレージのコストが予想以上に高くなっています。現在、通常の実行では、各マイクロバッチのデータが3秒未満で処理されています。レコード数0のマイクロバッチが1分間に少なくとも12回処理されています。ストリーミング書き込みは、デフォルトのトリガー設定を使用して構成されています。本番環境ジョブは現在、他の多くのDatabricksジョブと共に、インスタンスプールがプロビジョニングされたワークスペースでスケジュールされており、バッチ実行を含むジョブの起動時間を短縮しています。
他のすべての変数を一定に保ち、レコードを 10 分以内に処理する必要があると仮定すると、どの調整が要件を満たすでしょうか。
A. トリガー間隔を 10 分に設定します。各バッチはソース ストレージ アカウント内の API を呼び出すため、トリガー頻度を最大許容しきい値まで下げると、このコストが最小限に抑えられます。
B. トリガー 1 回オプションを使用し、10 分ごとにクエリを実行するように Databricks ジョブを構成します。このアプローチにより、コンピューティングとストレージの両方のコストが最小限に抑えられます。
C. チェックポイント ディレクトリを変更せずにトリガー間隔を変更することはできないため、並列処理を最大化するためにシャッフル パーティションの数を増やします。
D. トリガー間隔を 500 ミリ秒に設定します。トリガー間隔を小さく、かつゼロ以外の値に設定すると、ソースが頻繁にクエリされなくなります。
E. トリガー間隔を 3 秒に設定します。デフォルトのトリガー間隔では、バッチあたりのレコード消費量が多すぎるため、ディスクへの書き込みが発生し、ボリューム コストが増加する可能性があります。
問題 #2
データエンジニアは、パイプラインに直接接続されたDatabricksノートブックを使用して、Lakeflow宣言型パイプライン(LDP)を開発しています。ノートブックに新しいテーブル定義と変換ロジックを追加した後、実際にデータを処理したりパイプラインを実行したりすることなく、パイプラインコードに構文エラーがないかチェックしたいと考えています。データエンジニアはこの構文チェックをどのように実行すればよいでしょうか?
A. 検証および診断ツールにアクセスするには、ノートブックではなくワークスペース ファイルに切り替えます。
B. ノートブックの「検証」オプションを使用して、構文エラーがないか確認します。
C. コード検証機能にアクセスするには、ノートブックをパイプラインから切断し、コンピューティング クラスターに再接続します。
D. ノートブックから Web ターミナルを開き、シェル コマンドを実行してパイプライン コードを検証します。
問題 #3
データ アーキテクトは、データが外部ソースから Databricks Lakehouse に取り込まれたら、テーブル アクセス制御を活用してすべての運用テーブルとビューのアクセス許可を管理することを決定しました。
次のロジックを実行して、運用データベースでの対話型クエリの権限をコア エンジニアリング グループに付与しました。
データベース prod の使用権限を eng に付与します。
データベース prod に対する SELECT 権限を eng に付与します。
これらが eng グループに付与されている唯一の権限であり、これらのユーザーはワークスペース管理者ではないと仮定すると、どのステートメントがそれらの権限について説明していますか?
A. グループ メンバーは prod データベースに対する完全な権限を持ち、他のユーザーまたはグループに権限を割り当てることもできます。
B. グループ メンバーは、prod データベース内のすべてのテーブルとビューを照会および変更できますが、新しいテーブルやビューを作成することはできません。
C. グループ メンバーは prod データベース内のすべてのテーブルを一覧表示できますが、それらのテーブルに対するクエリの結果を表示することはできません。
D. グループ メンバーは prod データベース内のすべてのテーブルとビューをクエリできますが、データベース内で何も作成または編集することはできません。
E. グループ メンバーは、prod データベース内のすべてのテーブルとビューを作成、クエリ、および変更できますが、カスタム関数を定義することはできません。
問題 #4
施設監視チームは、Delta テーブル device_readings からほぼリアルタイムの PowerBI ダッシュボードを構築しています。
列:
device_id (文字列、一意のセンサーID)
event_ts (TIMESTAMP、取り込みタイムスタンプ UTC)
temperature_c (DOUBLE、温度(℃))
要件:
各センサーについて、重複しない5分ごとに1行生成する
間隔、2 分ずつオフセットされます (例: 00:02-00:07、00:07-00:12、...)。
各行には、間隔の開始、間隔の終了、平均を含める必要があります。
そのスライスの温度。
下流のBIツール(Power BIなど)は、間隔タイムスタンプを使用する必要があります。
時系列バーをプロットします。
A. デバイスIDを選択します。
イベントts、
AVG(温度_c) OVER (
デバイスIDによるパーティション
イベントtsで順序付け
5分前の行と現在の行の間の範囲
) AS 平均温度5分
device_readingsから
WINDOW w AS (window(event_ts, '5 分', '2 分'));
B. デバイスIDを選択します。
window.start AS bucket_start、
window.end AS bucket_end、
AVG(温度_c) AS avg_temp_5m
device_readingsから
GROUP BY device_id、window(event_ts、'5 minutes'、'5 minutes'、'2 minutes') ORDER BY device_id、bucket_start;
C. バケットを AS として (
デバイスIDを選択します。
window(event_ts, '5分', '2分', '5分') AS勝利、
温度_c
device_readingsから
)
デバイスIDを選択します。
win.start AS bucket_start、
win.end AS bucket_end、
AVG(温度_c) AS avg_temp_5m
バケットから
GROUP BY device_id、win
デバイスID、バケット開始で順序付けします。
D. デバイスIDを選択します。
date_trunc('minute', event_ts - 間隔 2 分) + 間隔 2 分 AS bucket_start、date_trunc('minute', event_ts - 間隔 2 分) + 間隔 7 分 AS bucket_end、AVG(temperature_c) AS avg_temp_5m FROM device_readings GROUP BY device_id、date_trunc('minute', event_ts - 間隔 2 分) ORDER BY device_id、bucket_start;
問題 #5
データ エンジニアリング チームは、Databricks Lakehouse Monitoring を使用して、Delta テーブル内の重要な列の percent_null メトリックを追跡します。
プロファイル メトリック テーブル (prod_catalog.prod_schema.customer_data_profile_metrics) には、1 時間ごとの percent_null 値が格納されます。
チームの目標:
percent_nullの1日平均が5%を超えるとアラートを発動します。
3日連続。
問題が継続している間は通知がスパムにならないようにします。
A. daily_avg を (
SELECT DATE_TRUNC('DAY', window.end) AS day,
AVG(percent_null) AS avg_null
prod_catalog.prod_schema.customer_data_profile_metrics から
GROUP BY DATE_TRUNC('DAY', window.end)
)
SELECT day, avg_null
daily_avgから
日付順(降順)
制限3
アラート条件: 最新の 3 行の avg_null がすべて 5 より大きい
通知頻度: 1回のみ
B. AVG(percent_null) を daily_avg として選択する
prod_catalog.prod_schema.customer_data_profile_metrics から
window.end >= CURRENT_TIMESTAMP - INTERVAL '3' DAY
アラート条件: daily_avg > 5
通知頻度: アラートが評価されるたびに
C. SELECT SUM(CASE WHEN percent_null > 5 THEN 1 ELSE 0 END) AS violation_days FROM prod_catalog.prod_schema.customer_data_profile_metrics WHERE window.end >= CURRENT_TIMESTAMP - INTERVAL '3' DAY アラート条件: violation_days >= 3 通知頻度: 1 回のみ
D. percent_null を選択
prod_catalog.prod_schema.customer_data_profile_metrics から
window.end >= CURRENT_TIMESTAMP - INTERVAL '1' DAY
アラート条件: percent_null > 5
通知頻度: 最大24時間ごと
問題與答案:
| 問題 #1 答案: A | 問題 #2 答案: B | 問題 #3 答案: D | 問題 #4 答案: C | 問題 #5 答案: A |

下載最新試用版
我們對我們的產品非常有信心,所以我們不提供会给客户带去麻煩的產品。


0位客戶反饋


