匯出數據¶
大綱¶
資料匯出是每小時提取載入到 Hive 分析中的事件資料並將其上傳到雲端儲存的功能。
數據導出提供的數據是事件行(raw)數據,可以根據目的直接建庫或加工成所需的形式用於分析。
檔案轉換和資料傳輸由 Hive Analytics 提供,但雲端儲存需要註冊您正在使用的雲端服務。
Note
由於資料是按事件提供的,不支援按項目拆分傳輸。
你能做什麼?¶
資料分析師¶
- 您可以將從Hive分析中收集的資料直接載入到您公司的DB中,將其處理成所需的形式,並進行深入分析。
- 您可以透過將原始資料連結到您自己的BI工具或分析環境來建立自訂儀表板。
開發者¶
- 您可以自動將 Hive 事件資料載入到您自己的資料管道中。
- 透過與AWS S3或GCP Cloud Storage鏈接,您可以直接從雲端儲存中利用每小時的最新事件資料。
快速上手¶
如果您是首次設定資料匯出,請按照以下步驟完成雲端儲存整合。
- 在您要使用的雲端儲存上建立資料匯出專用桶(AWS S3 或 GCP Cloud Storage)並準備驗證。
- 存取分析控制台 > 資料 > **資料匯出**設定頁。
- 選擇要提取的事件(日誌)。 (最多 30 個)
- 選擇儲存(AWS S3 / GCP Cloud Storage)並輸入儲存桶名稱。
- 選擇資料類型 (CSV / JSON)。
- 註冊驗證金鑰。
Note
有關如何為每個雲端儲存建立儲存桶和頒發身分驗證金鑰的信息,請參閱所有功能。
全功能¶
資料匯出邏輯¶
BigQuery中儲存的事件資料會依照每小時的資料匯出週期轉換為檔案並上傳到註冊的雲端儲存。
基於數據¶
- 搜尋選定的事件資料並將檔案傳輸到雲端儲存。
- 基於UTC的每小時傳輸週期擷取資料。
- 範例)根據2023年9月1日00:00:00至00:59:59(UTC)的數據,於2023年9月1日01:00(UTC)擷取並傳送
- dateTime 屬性的分區標準設定為檢視日期 -1 day。
- 範例)根據 2023 年 9 月 1 日 00:00:00 至 00:59:59 (UTC)、2023 年 8 月 30 日 00:00:00 的資料擷取時
- 如果datetime的值小於觀看時間-1 day,則不會包含在匯出資料中。
- 根據資料輸入 Big Query 的時間搜尋資料。
- 基於
bigqueryRegistTimestamp屬性 - 資料擷取 sample Query
- 基於
SELECT *
FROM bigquery_table
WHERE bigqueryRegistTimestamp BETWEEN '2023-09-01 00:00:00' and '2023-09-01 00:59:59'
and dateTime >= '2023-08-31 00:00:00'
資料匯出設定¶
選擇事件¶
選擇要提取的事件(日誌)。
- 您可以透過輸入活動名稱的一部分來搜尋和選擇。
- 最多可選擇 30 個事件。
選擇儲存庫¶
您應該使用雲端儲存作為儲存資料的儲存庫。
支援的雲端:
- AWS S3
- GCP Google Cloud Storage
位置(儲存桶名稱)¶
輸入儲存桶 (bucket) 名稱。
- AWS S3 若儲存桶名稱為
s3://s3_bucket_name→ 僅輸入s3_bucket_name - Google Cloud Storage 若儲存桶名稱為
gs://google_bucket_name→ 只輸入google_bucket_name
資料型別¶
提供了兩種資料類型。
- CSV
- JSON
- 所有檔案均使用 UTF-8 進行編碼。
文件上傳週期¶
每小時提取並上傳每小時範圍內的資料。
- 根據
bigqueryRegistTimestamp屬性值提取時間。 (基於UTC)- 範例)資料擷取和上傳從 15:00 開始(基於 UTC):從 05:00:00 到 05:59:59 的資料從
bigqueryRegistTimestamp屬性中提取。
- 範例)資料擷取和上傳從 15:00 開始(基於 UTC):從 05:00:00 到 05:59:59 的資料從
- 完成時間可能會因文件數量和上傳容量而異。
註冊認證金鑰¶
將資料上傳到雲端儲存需要許可。您必須註冊具有資料儲存權限的認證金鑰或認證金鑰檔案。認證金鑰註冊方法因雲端服務而異。
雲端儲存設定¶
GCP - Google Cloud Storage¶
要將資料匯出到 Google Cloud,需要進行以下設定。
-
在 Google Cloud Console 頁面上,前往 Cloud Storage。
-
建立桶(bucket)專用於資料匯出。
- 儲存桶名稱一旦設定就無法更改,如有必要,必須刪除現有儲存桶並建立新儲存桶。
- **建議建立專門用於資料匯出的Bucket。 **
-
您必須建立服務金鑰以提供資料匯出並授予儲存桶寫入權限。
- 在控制台頁面上,前往 IAM 和管理員 → 服務帳號選單。
- 點選建立服務帳戶 建立新帳戶。
- 再次前往 Cloud Storage,並在已建立的 bucket 中開啟權限分頁。

- 在「權限」標籤中,在「授予存取權限」→「新增主要成員」中輸入新建立的服務帳戶 ID。
- 在角色指派中,新增兩個權限 Cloud Storage → 儲存物件建立者、儲存物件檢視者,然後按一下確定。
-
完成所有設定後,在Hive Analytics的資料匯出設定頁面註冊服務的金鑰檔案。
AWS - S3¶
要將資料匯出到AWS,需要進行以下設定。
- 在 AWS 控制台頁面上,導覽至 儲存 → S3。

- 建立專用於資料匯出的儲存桶(bucket)。
- 儲存桶名稱一旦設定就無法更改,如有必要,必須刪除現有儲存桶並建立新儲存桶。
- **建議僅用作資料匯出的儲存桶。 **
- 您需要建立一個帳戶才能匯出資料。
- 該使用者只能用作資料匯出的專用帳戶。建立一個新的 IAM user。
- 為您建立的帳戶產生存取金鑰。相關資訊可參考IAM使用者存取金鑰管理-存取金鑰產生。
- 將您的存取金鑰存放在安全的地方。
- 為您建立的帳戶新增 inline policy。
- 請參閱包含使用者群組的內聯策略(控制台)並建立原則。
- 選擇JSON標籤建立policy,並貼上以下JSON代碼。
YOUR-BUCKET-NAME-HERE項指定建立的桶名稱。
{
"Version": "2012-10-17",
"Statement": [
{
"Effect": "Allow",
"Action": ["s3:GetBucketLocation", "s3:ListBucket"],
"Resource": ["arn:aws:s3:::YOUR-BUCKET-NAME-HERE"]
},
{
"Effect": "Allow",
"Action": ["s3:PutObject"],
"Resource": ["arn:aws:s3:::YOUR-BUCKET-NAME-HERE/*"]
}
]
}
- 完成後,將已儲存的存取金鑰新增至 Analytics 控制台 > 資料 > 資料匯出設定。
檔案保存格式¶
資料儲存目錄結構¶
常見的檔案路徑格式:
- 建構類型:有兩個值:
sandbox和live。設定為 sandbox 時,將儲存為 sandbox。 - YYYY/MM/DD:擷取資料的標準年/月/日。 (基於UTC)
- UUID:隨機值,以防止因重複檔案名稱而覆寫。
- 檔案副檔名:取決於所選的檔案類型。
| 檔類型 | 是否壓縮 | 最終檔名 |
|---|---|---|
| json | V | withhive/data_export/buildType/YYYY/MM/DD/eventName/eventName_YYYY_MM_DD_UUID.json.gzip |
| csv | V | withhive/data_export/buildType/YYYY/MM/DD/eventName/eventName_YYYY_MM_DD_UUID.csv.gzip |
檔案副檔名¶
- csv.gzip:由資料組成的文件,欄位之間以逗號 (,) 分隔。壓縮檔案時無法進行加密設定(不支援)。
- json.gzip: Javascript 由以物件語法建構的資料字元所組成的檔案。它以行分隔,是將json檔案壓縮為gzip的檔案。壓縮檔案時無法進行加密設定(不支援)。
注意事項 & Tips¶
- 過去的資料無法追溯:資料匯出從註冊時開始進行。註冊前收集的歷史資料將不會追溯轉移。
- 最大事件數量限制:可選擇的最大事件數量為 30。
- 限制每個事件提取的數據總量:提取數據時,如果超過500Mbytes,將被排除在傳輸之外。實際傳輸的資料是大約15%的壓縮檔案。





