Hướng dẫn xuất dữ liệu thô (raw data) phân bổ di động để phân tích tỷ lệ giữ chân

opoinstall
2026-08-11
5 min read

Làm thế nào để xuất dữ liệu phân bổ di động thô cho việc phân tích tỷ lệ giữ chân (cohort analysis)? Việc xuất dữ liệu phân bổ ở cấp độ sự kiện cho phép các đội ngũ dữ liệu phân tích nhóm người dùng thông qua các tệp xuất CSV/JSON hoặc các luồng dữ liệu S2S được kết nối với hệ thống phân tích nội bộ.

Dữ liệu thô (Raw data) đề cập đến các dữ liệu từ xa ở cấp sự kiện chưa qua tổng hợp, bao gồm dấu thời gian (timestamps), tham số phân bổ và dữ liệu chuyển đổi trước khi được báo cáo tổng hợp. Bằng cách cung cấp toàn quyền truy cập vào các bản ghi sự kiện thô mà không cần lấy mẫu hoặc tóm tắt tính toán trước, dữ liệu thô cho phép các đội ngũ dữ liệu thực hiện kiểm toán nhóm tỷ lệ giữ chân tùy chỉnh, kết hợp các tín hiệu phân bổ với cơ sở dữ liệu BI nội bộ và duy trì quyền kiểm soát lưu trữ trực tiếp trong hệ thống dữ liệu của mình.

Thuật ngữ Định nghĩa Khái niệm liên quan
Dữ liệu thô (Raw Data) Dữ liệu từ xa cấp sự kiện chưa qua tổng hợp, chứa dấu thời gian và tham số phân bổ trước khi tổng hợp báo cáo. Tiếp nhận sự kiện (Event Ingestion)
Phân tích Cohort Đánh giá các chỉ số giữ chân theo hành vi giữa các nhóm người dùng cụ thể theo thời gian. Ma trận giữ chân
Theo dõi chuyển đổi Ghi lại các sự kiện thu hút và hành động của người dùng sau khi cài đặt như cài đặt, đăng ký và mua hàng. Luồng S2S (S2S Stream)
Kho dữ liệu (Data Warehouse) Cơ sở hạ tầng lưu trữ trung tâm dùng để xử lý các sự kiện phân bổ thô và thực hiện truy vấn nhóm. Nhật ký cấp sự kiện (Event-Level Logs)

Câu trả lời ngắn gọn

Việc xuất dữ liệu phân bổ di động thô cho phép đội ngũ dữ liệu truy cập các bản ghi phân bổ cấp sự kiện, tải chúng vào kho dữ liệu nội bộ và xây dựng các nhóm người dùng (cohort) tùy chỉnh ngoài những chỉ số có sẵn trên bảng điều khiển.

Tại sao báo cáo tổng hợp bị hạn chế đối với việc phân tích tỷ lệ giữ chân chuyên sâu

Những hạn chế cố hữu của các bảng điều khiển báo cáo tổng hợp

Các đối tác đo lường di động (MMP) thường trình bày hiệu suất chiến dịch thông qua các bảng tóm tắt đã được tổng hợp sẵn. Các chế độ xem này nhóm các hành động của người dùng thành các chỉ số cố định—chẳng hạn như tổng số nhấp chuột hàng ngày, lượt cài đặt hoặc tỷ lệ giữ chân ngày thứ 1 (Day-1). Mặc dù báo cáo tóm tắt cung cấp khả năng hiển thị cấp cao cho các quản lý chiến dịch, nhưng nó vốn dĩ che khuất dữ liệu từ xa chi tiết cần thiết cho việc phân tích sản phẩm nâng cao.

Các báo cáo tổng hợp áp đặt các chiều dữ liệu cứng nhắc, ngăn cản đội ngũ dữ liệu thực hiện phân tích đa chiều tùy chỉnh. Ví dụ, nếu một chuyên gia phân tích muốn kiểm tra tỷ lệ giữ chân nhóm dựa trên sự kết hợp phức tạp của các tham số—chẳng hạn như người giới thiệu trong ứng dụng, mã giảm giá động và đặc tính mạng lưới khu vực—các bảng tóm tắt không thể thực hiện được truy vấn này. Hơn nữa, một số nền tảng phân tích có thể áp dụng việc tổng hợp hoặc lấy mẫu tùy thuộc vào quy mô và cấu hình báo cáo, dẫn đến sai số thống kê làm ảnh hưởng đến độ chính xác của kết quả kiểm tra.

Đồ họa so sánh cao cấp giữa bảng điều khiển báo cáo tổng hợp và luồng dữ liệu thô chưa tổng hợp cho phân tích nhóm người dùng tùy chỉnh.

Cách dữ liệu phân bổ thô hỗ trợ phân tích Cohort chuyên sâu

Dữ liệu phân bổ cấp sự kiện chưa tổng hợp được sử dụng để tính toán tỷ lệ giữ chân, LTV và hiệu suất phân bổ từ các bản ghi cấp sự kiện, cho phép đội ngũ phân tích đánh giá mức độ suy giảm giữ chân trên các kênh và xây dựng các mô hình phân bổ tùy chỉnh bằng dữ liệu cấp sự kiện vượt xa các chiều dữ liệu mặc định của bảng điều khiển. Bằng cách trích xuất các bản ghi sự kiện phân bổ, các chuyên gia phân tích có quyền truy cập vào luồng sự kiện cơ bản cần thiết để đo lường đóng góp của chiến dịch dựa trên các bản ghi sự kiện xuyên suốt mọi điểm tiếp cận marketing.

Mở khóa những hiểu biết chi tiết: Kết hợp dữ liệu từ xa phân bổ với cơ sở dữ liệu giao dịch bên thứ nhất

Việc xuất dữ liệu phân bổ cấp sự kiện giúp chuyển đổi phép đo di động từ một hầm chứa báo cáo biệt lập thành một tập dữ liệu tích hợp. Các bản ghi chưa tổng hợp nắm bắt được các tương tác riêng lẻ: nhấp chuột quảng cáo, chuyển hướng đến cửa hàng, khởi chạy ứng dụng gốc, đăng ký hoặc mua hàng trong ứng dụng.

Bằng cách truyền hoặc tải xuống các bản ghi sự kiện phân bổ, đội ngũ kỹ thuật dữ liệu có thể kết hợp dữ liệu từ xa phân bổ với các cơ sở dữ liệu bên thứ nhất (như hệ thống CRM, sổ cái giao dịch hoặc nền tảng hỗ trợ khách hàng). Sử dụng các khóa kết hợp chung—như ID tài khoản người dùng nội bộ, mã thông báo khớp nối mã hóa hoặc tham chiếu giao dịch—các chuyên gia phân tích có thể lập bản đồ hành trình trọn đời của một nhóm người dùng từ lúc tiếp xúc quảng cáo ban đầu cho đến doanh thu nhiều năm sau khi cài đặt.

Duy trì quyền kiểm soát lưu trữ trực tiếp trên các đường ống dữ liệu

Việc chỉ dựa vào các bảng điều khiển báo cáo tổng hợp sẽ khiến các thương hiệu di động gặp phải những rủi ro vận hành liên quan đến quản trị và lưu trữ dữ liệu. Nếu một mạng lưới quảng cáo hoặc nhà cung cấp phân bổ thay đổi logic báo cáo nội bộ, các tính toán khoảng thời gian xem xét lại (lookback window) hoặc quy tắc khử trùng lặp (de-duplication), các số liệu tóm tắt lịch sử có thể thay đổi mà không có sự minh bạch về dữ liệu gốc.

Việc trích xuất nhật ký sự kiện thô đảm bảo quyền kiểm soát lưu trữ trực tiếp trong hệ thống dữ liệu nội bộ, cho phép các đội ngũ tái tạo các truy vấn lịch sử và kiểm toán logic phân bổ. Việc lưu trữ các lược đồ sự kiện chi tiết trong kho dữ liệu đảm bảo một dấu vết kiểm toán vĩnh viễn, không thể thay đổi. Đội ngũ kỹ thuật có thể xử lý lại các nhật ký lịch sử theo các mô hình phân bổ được cập nhật hoặc logic kinh doanh nội bộ tùy chỉnh bất cứ lúc nào, đảm bảo sự minh bạch hoàn toàn trong các báo cáo tài chính và vận hành. Các nền tảng đo lường di động như Openinstall có thể cung cấp các luồng sự kiện thô chưa tổng hợp để hỗ trợ các đường ống dữ liệu.

Cách luồng nhật ký chưa tổng hợp hỗ trợ kết nối kho dữ liệu nội bộ

Thiết lập kiến trúc: Tiếp nhận luồng sự kiện Webhook S2S vào kho dữ liệu

Việc tích hợp dữ liệu từ xa phân bổ thô vào các kho dữ liệu (như Snowflake, Google BigQuery hoặc Amazon Redshift) chủ yếu đạt được thông qua luồng sự kiện Server-to-Server (S2S). Thay vì chờ đợi việc xuất tệp hàng ngày, công cụ phân bổ sẽ gửi một tệp payload HTTP POST webhook tới điểm cuối tiếp nhận ngay sau khi xử lý một sự kiện.

Một dịch vụ tiếp nhận sẽ nhận tệp JSON thô, xác thực các tiêu đề yêu cầu và đệm luồng sự kiện đến vào hàng đợi tin nhắn hoặc thùng lưu trữ tạm thời. Các bộ tải luồng dữ liệu liên tục đọc từ bộ đệm, chèn các bản ghi sự kiện phân bổ vào các bảng kho dữ liệu mục tiêu với độ trễ tiếp nhận thấp.

Kiến trúc đường ống dữ liệu 5 giai đoạn kỹ thuật cao, ánh xạ việc truyền dữ liệu sự kiện thô di động từ SDK đến báo cáo nhóm trong kho dữ liệu.

Kết hợp các khóa phân bổ di động với ID người dùng nội bộ

Để thực hiện phân tích tỷ lệ giữ chân nhóm (cohort), nhật ký phân bổ thô phải được kết hợp với dữ liệu từ xa về sản phẩm nội bộ. Các lược đồ sự kiện thô ghi lại cả siêu dữ liệu phân bổ và các tham số ngữ cảnh động được truyền qua SDK di động.

Khi người dùng mới khởi chạy ứng dụng, SDK gốc sẽ thực thi một truy vấn tham số cài đặt, truy xuất các mã thông báo giới thiệu, ID người mời hoặc khóa chiến dịch. Sau khi người dùng tạo tài khoản hoặc hoàn thành giao dịch trong ứng dụng, ứng dụng sẽ truyền user_id nội bộ cho SDK phân bổ. Sau đó, các kỹ sư dữ liệu sẽ thực thi các thao tác nối SQL (SQL join) kết hợp bảng nhật ký phân bổ thô với các bảng giao dịch nội bộ:

textUserJourney=textAttributionLogTablebowtie_textinternal_user_idtextCRMTransactionLedger\\text{User Journey} = \\text{Attribution Log Table} \\bowtie\_{\\text{internal\_user\_id}} \\text{CRM Transaction Ledger}

Cấu trúc liên kết này cho phép các chuyên gia phân tích đánh giá nhóm giữ chân dựa trên cả nguồn marketing trước cài đặt và hành vi sản phẩm sau cài đặt.

Đo lường tuân thủ quyền riêng tư trong Data Clean Room

Khi các khung bảo mật của hệ điều hành hạn chế việc theo dõi người dùng theo phương pháp quyết định (deterministic), các tổ chức ngày càng triển khai Data Clean Rooms (DCR) để đối chiếu ngân sách marketing với hiệu suất của nhà xuất bản. Data Clean Rooms cho phép các nhà quảng cáo và mạng lưới quảng cáo truy vấn các tập dữ liệu kết hợp trong một môi trường an toàn và cô lập về quyền riêng tư.

Nhật ký sự kiện thô đóng vai trò là đầu vào cho các kiến trúc Data Clean Room. Bằng cách xuất các luồng sự kiện chưa tổng hợp chứa các định danh bảo vệ quyền riêng tư hoặc các định danh nhóm ẩn danh, đội ngũ dữ liệu có thể thực hiện các truy vấn giao thoa an toàn mà không làm lộ dữ liệu cá nhân.

Sự khác biệt về cấu trúc giữa Báo cáo tổng hợp và Nhật ký dữ liệu thô

Đánh giá so sánh giữa Báo cáo tổng hợp và Luồng sự kiện thô chi tiết

Việc lựa chọn cơ chế phân phối dữ liệu phù hợp phụ thuộc vào mức độ trưởng thành kỹ thuật của tổ chức, năng lực lưu trữ và độ phức tạp của truy vấn. Các bảng điều khiển tổng hợp phục vụ các quản lý chiến dịch vận hành, trong khi dữ liệu phân bổ cấp sự kiện hỗ trợ các kỹ sư dữ liệu và chuyên gia phân tích định lượng.

Bảng dưới đây so sánh các đặc điểm cấu trúc chính giữa các phương pháp báo cáo khác nhau:

Chỉ số hiệu suất Bảng điều khiển tổng hợp Tệp xuất CSV hàng ngày Luồng dữ liệu thô S2S
Độ chi tiết dữ liệu Số liệu tóm tắt đã tính toán Ảnh chụp sự kiện cấp người dùng Dữ liệu từ xa cấp sự kiện chi tiết
Độ linh hoạt truy vấn Giới hạn ở các chiều dữ liệu cố định Cao (Cần tập lệnh tùy chỉnh) Phân tích SQL linh hoạt & tích hợp BI
Độ trễ tích hợp Cập nhật theo giờ/ngày Đóng gói xuất theo ngày Truyền luồng gần như thời gian thực
Kiểm toán nhóm (Cohort) Cửa sổ thời gian cố định Hỗ trợ thông qua phân tích ngoại tuyến Mô hình nhóm N-Day linh hoạt
Quyền sở hữu dữ liệu Nhà cung cấp lưu trữ và tóm tắt Bản sao tệp phẳng đã xuất Kiểm soát lưu trữ trực tiếp trong hệ thống nội bộ

Ma trận so sánh giữa bảng điều khiển tổng hợp, tệp xuất CSV và luồng dữ liệu thô S2S cho phân tích giữ chân.

Đánh giá độ linh hoạt, yêu cầu lưu trữ và hiệu suất truy vấn

Mặc dù luồng dữ liệu thô mang lại sự linh hoạt trong phân tích, nhưng nó đòi hỏi cơ sở hạ tầng lưu trữ liên tục và lập chỉ mục cơ sở dữ liệu tối ưu. Các ứng dụng di động quy mô lớn tạo ra hàng triệu sự kiện mỗi ngày có thể tích lũy khối lượng lớn nhật ký JSON thô hàng tháng.

Để cân bằng giữa hiệu suất truy vấn và chi phí lưu trữ, đội ngũ kỹ thuật dữ liệu thường triển khai kiến trúc lưu trữ đa tầng. Các luồng sự kiện chưa tổng hợp được đưa vào các cơ sở dữ liệu cột hiệu suất cao để phân tích nhóm 30 ngày ngay lập tức, sau đó các nhật ký lịch sử được phân vùng theo ngày và lưu trữ vào các thùng lưu trữ lạnh (như AWS S3 hoặc Google Cloud Storage) dưới định dạng Parquet nén.

Chuẩn hóa Lược đồ xuất dữ liệu thô JSON và CSV

Các trường lược đồ thiết yếu trong dữ liệu phân bổ thô

Để đảm bảo quá trình ETL diễn ra trơn tru trên các đường ống dữ liệu tự động, các lược đồ sự kiện phân bổ thô phải duy trì quy ước đặt tên trường và kiểu dữ liệu nhất quán. Mỗi bản ghi nhật ký sự kiện thô bao gồm các lớp dữ liệu từ xa riêng biệt:

  • Siêu dữ liệu sự kiện: ID giao dịch duy nhất, tên sự kiện (install, register, purchase) và dấu thời gian UTC chính xác.

  • Định danh phân bổ: AppKey, mã kênh (channelCode), ID chiến dịch, ID nhóm quảng cáo, ID mẫu quảng cáo và tên mạng lưới xuất bản.

  • Giới thiệu & Tải trọng tùy chỉnh: Các tham số ngữ cảnh được truyền qua liên kết web (ví dụ: ID người mời, mã voucher, số phòng).

  • Bối cảnh thiết bị & môi trường: Loại hệ điều hành, phiên bản OS, phiên bản ứng dụng, phiên bản SDK và các đặc tính mạng lưới cơ bản.

Cấu trúc tải trọng sự kiện JSON để lưu trữ

JSON là định dạng tiêu chuẩn cho luồng sự kiện S2S nhờ cấu trúc phân cấp, linh hoạt. Các đối tượng lược đồ JSON cho phép các kiểu dữ liệu lồng nhau, cho phép các tải trọng ngữ cảnh phức tạp được truyền trong một thông báo duy nhất.

Các nhà phát triển có thể tham khảo tài liệu xuất dữ liệu thô của Openinstall để biết thông số kỹ thuật liên quan đến lược đồ nhật ký sự kiện thô và định nghĩa trường. Các kỹ sư muốn đánh giá cấu hình theo dõi phía máy khách có thể tham khảo tài nguyên tích hợp SDK phân bổ của Openinstall để xem lại thiết lập cấu trúc tải trọng.

Lược đồ JSON dưới đây minh họa một tải trọng sự kiện phân bổ thô được tạo ra khi có sự kiện cài đặt ứng dụng:

```json
{
“example_only”: true,
“event_type”: “raw_attribution_event”,
“app_id”: “com.example.app”,
“event_metadata”: {
  “raw_event_id”: “raw_evt_112233445566”,
  “event_name”: “app_install”,
  “event_timestamp_utc”: “2026-08-11T03:15:22.104Z”,
  “ingestion_timestamp_utc”: “2026-08-11T03:15:22.128Z”
},
“attribution_context”: {
  “channel_code”: “google_search_global”,
  “campaign_id”: “cmp_search_core_01”,
  “ad_group_id”: “ag_intent_exact”,
  “creative_id”: “cr_text_v3”,
“match_type”: “deterministic”,
  “lookback_window_days”: 7
},
“custom_payload”: {
  “inviter_user_id”: “usr_99887766”,
  “voucher_code”: “WELCOME2026”,
  “internal_account_id”: “acc_33211”
},
“device_telemetry”: {
  “os_type”: “Android”,
  “os_version”: “14.0”,
  “app_version”: “2.4.0”,
  “sdk_version”: “1.0.0”,
  “country_code”: “US”,
  “network_type”: “wifi”
}
}

Bố cục tiêu đề CSV và chuẩn hóa trường cho quy trình ETL tự động

Đối với xuất tệp hàng loạt, các cấu trúc CSV phẳng được sử dụng rộng rãi nhờ tính tương thích tự nhiên với các tiện ích tải dữ liệu truyền thống (như COPY trong PostgreSQL hoặc COPY INTO trong Snowflake). Các đường ống xuất CSV chuẩn hóa các đối tượng JSON phân cấp thành các tiêu đề cột phẳng.

Để ngăn chặn lỗi đường ống ETL trong khi phân tích CSV, các quy tắc thoát ký tự (escaping) phải được thực thi nghiêm ngặt. Các trường chuỗi chứa dấu phẩy, ngắt dòng hoặc dấu ngoặc kép phải được đặt trong dấu ngoặc kép và dấu thời gian phải tuân thủ nghiêm ngặt định dạng chuỗi UTC ISO 8601 (YYYY-MM-DDTHH:MM:SS.sssZ).

Cách kiểm toán tỷ lệ giữ chân Cohort từ D1 đến D30 bằng nhật ký cài đặt thô

Công thức toán học về mức độ suy giảm giữ chân của Cohort

Một nhóm giữ chân (cohort) được định nghĩa là một nhóm người dùng riêng biệt đã hoàn thành một sự kiện kích hoạt chính (thường là khởi chạy ứng dụng ban đầu sau khi cài đặt) trong một cửa sổ thời gian cụ thể t_0t\_0. Tỷ lệ giữ chân R_tR\_t tại tt ngày sau cài đặt đại diện cho tỷ lệ của nhóm ban đầu U_0U\_0 đã ghi lại ít nhất một phiên hoạt động vào ngày tt:

R_t=fracU_tU_0times100R\_t = \\frac{U\_t}{U\_0} \\times 100\\%

Trong đó:

  • U_0U\_0 là tổng số lượng người dùng duy nhất đã cài đặt và kích hoạt ứng dụng vào Ngày 0.

  • U_tU\_t là số lượng người dùng duy nhất từ U_0U\_0 đã thể hiện sự tương tác tích cực vào Ngày tt.

Sử dụng nhật ký sự kiện thô, các chuyên gia phân tích dữ liệu xây dựng chính xác các ma trận giữ chân N-Day bằng cách truy vấn nhật ký phiên của người dùng duy nhất hàng ngày đối với các bản ghi dấu thời gian cài đặt ban đầu.

-- Ví dụ mẫu SQL: Trích xuất giữ chân nhóm D1-D30 từ nhật ký thô
-- Lưu ý: Cú pháp SQL thay đổi tùy theo kho dữ liệu (Snowflake, BigQuery, PostgreSQL)
SELECT
   DATE(install_timestamp_utc) AS install_date,
  channel_code,
   COUNT(DISTINCT user_id) AS cohort_size,
   COUNT(DISTINCT CASE WHEN DATEDIFF(day, install_timestamp_utc, event_timestamp_utc) = 1 THEN user_id END) AS d1_retained,
   COUNT(DISTINCT CASE WHEN DATEDIFF(day, install_timestamp_utc, event_timestamp_utc) = 7 THEN user_id END) AS d7_retained
FROM attribution_raw_events
GROUP BY 1, 2;

Lọc bỏ các lượt cài đặt không tăng trưởng và hành vi gian lận

Các chỉ số tổng hợp trên bảng điều khiển thường tính toán tỷ lệ giữ chân bằng cách sử dụng các lượt cài đặt chưa được lọc, điều này có thể làm sai lệch tỷ lệ giữ chân. Xuất dữ liệu thô cho phép các nhà phân tích thực thi các truy vấn làm sạch dữ liệu trước khi xây dựng nhóm.

Các chuyên gia phân tích áp dụng mệnh đề SQL WHERE để lọc bỏ các lượt cài đặt không hợp lệ hoặc không tăng trưởng:

  • Loại trừ tín hiệu gian lận: Loại bỏ các lượt cài đặt được đánh dấu là click injection (bơm nhấp chuột) hoặc chạy trên trình giả lập dựa trên các thuộc tính Time-To-Install (TTI) bất thường.

  • Chặn cài đặt lại: Loại trừ các lượt cài đặt trùng lặp từ những người dùng hiện tại tải xuống lại ứng dụng trên cùng thiết bị.

  • Cô lập lưu lượng tự nhiên (Organic): Tách các nhóm lưu lượng trả phí khỏi lưu lượng tự nhiên để đo lường mức tăng trưởng giữ chân thực tế.

Xây dựng ma trận giữ chân N-Day trên các kênh

Bằng cách thực thi các thao tác SQL GROUP BY trên các bảng nhật ký thô đã được chuẩn hóa, các nhà phân tích tạo ra các ma trận giữ chân nhóm đa chiều. Các bảng này đánh giá các đường cong suy giảm giữ chân trên các nguồn thu hút, mẫu quảng cáo hoặc chiến dịch khu vực khác nhau.

[Sự kiện di động / Cài đặt] ──> [Đường ống sự kiện thô Openinstall]
                                                                 │
                                                                 ▼
                                           [Luồng S2S / Xuất CSV]
                                                                  │
                                                                 ▼
                                           [Kho dữ liệu / BI]
                                                                  │
                                                                 ▼
                                           [Phân tích giữ chân nhóm D1-D30 tùy chỉnh]

Đánh giá tỷ lệ giữ chân trên các kênh thu hút khác nhau cho phép các nhóm tăng trưởng xác định các kênh tạo ra khối lượng cài đặt ban đầu lớn nhưng lại có tỷ lệ giảm sút đáng kể vào ngày thứ 7, từ đó cho phép phân bổ lại ngân sách quảng cáo cho các kênh mang lại giá trị LTV bền vững.

Cách khắc phục sự cố sai lệch tiếp nhận và trường dữ liệu bị thiếu trong nhật ký thô

Chẩn đoán trôi lược đồ (schema drift) và thiếu khóa tham số trong tải trọng SDK

Trôi lược đồ xảy ra khi các bản cập nhật ứng dụng phía máy khách giới thiệu các khóa tham số tùy chỉnh mới hoặc thay đổi kiểu dữ liệu tải trọng hiện có mà không cập nhật các lược đồ kho dữ liệu hạ nguồn. Nếu đường ống ETL gặp phải một chuỗi trong trường số, các tác vụ tiếp nhận tự động có thể thất bại hoặc loại bỏ bản ghi.

Để ngăn lỗi trôi lược đồ, các đường ống dữ liệu triển khai hàng đợi thư chết (DLQ). Các bản ghi sự kiện thô đến không vượt qua được kiểm tra lược đồ nghiêm ngặt sẽ được chuyển hướng đến một thùng chứa DLQ để kiểm tra thủ công, đảm bảo rằng các bản ghi hợp lệ trong đường ống tiếp tục được thực thi mà không bị gián đoạn.

Giải quyết sự khác biệt về dấu thời gian giữa UTC và múi giờ địa phương

Sự lệch dấu thời gian là nguyên nhân phổ biến gây ra sự khác biệt giữa các báo cáo BI nội bộ và bảng điều khiển của nhà cung cấp. Nhật ký sự kiện thô nắm bắt nhiều trường dấu thời gian:

  • device_timestamp_utc: Dấu thời gian địa phương được phần cứng thiết bị di động ghi lại tại thời điểm thực hiện sự kiện.

  • ingestion_timestamp_utc: Dấu thời gian do máy chủ tạo ra, được nút cạnh tiếp nhận ghi lại khi nhận tệp payload HTTP.

  • event_timestamp_utc: Dấu thời gian sự kiện chính thức, đã được xác minh do công cụ phân bổ áp dụng.

Các đường ống dữ liệu phải chuẩn hóa tất cả các trường dấu thời gian sang UTC trước khi thực hiện nhóm theo ngày. Việc dựa vào các dấu thời gian thiết bị chưa được xác thực có thể làm hỏng ranh giới nhóm do trôi đồng hồ thiết bị cục bộ hoặc do người dùng thao túng.

Xử lý việc ẩn danh dữ liệu do quyền riêng tư của mạng quảng cáo

Theo các chính sách quyền riêng tư hiện đại (như Apple SKAdNetwork (SKAN) hoặc Google Privacy Sandbox), các định danh người dùng và tham số truy vấn ngữ cảnh chi tiết thường xuyên bị che giấu hoặc trì hoãn bởi các mạng lưới xuất bản.

Khi xây dựng bảng nhật ký thô, các lược đồ cơ sở dữ liệu phải tính đến các trường có thể null (rỗng) trong các bản ghi bị hạn chế về quyền riêng tư. Các cột đại diện cho ID chiến dịch của nhà xuất bản hoặc siêu dữ liệu điểm tiếp cận chi tiết phải chấp nhận chuỗi NULL hoặc REDACTED, ngăn ngừa các ngoại lệ khi chèn cơ sở dữ liệu trong quá trình tiếp nhận sự kiện không được phân bổ hoặc được bảo vệ quyền riêng tư.

Danh sách kiểm tra 3 bước dành cho nhà phát triển để quản lý trôi lược đồ dữ liệu thô, chuẩn hóa dấu thời gian UTC và ẩn danh dữ liệu quyền riêng tư.

Câu hỏi thường gặp (FAQ)

Làm thế nào để xuất dữ liệu thô cho phân tích nhóm người dùng trong Openinstall?
Việc xuất dữ liệu thô trong Openinstall được thực hiện bằng cách truy cập bảng điều khiển, cấu hình webhook nhật ký thời gian thực S2S hoặc lập lịch xuất CSV hàng ngày tự động chứa dữ liệu sự kiện chưa tổng hợp.
Những trường nào được bao gồm trong các bản xuất dữ liệu phân bổ thô?
Các bản xuất dữ liệu phân bổ thô chứa các trường cấp sự kiện chi tiết, bao gồm dấu thời gian UTC, tên sự kiện, AppKey, mã kênh, siêu dữ liệu chiến dịch, tham số giới thiệu động và bối cảnh thiết bị cơ bản.
Dữ liệu xuất thô có thể được kết nối trực tiếp với kho dữ liệu không?
Có. Dữ liệu xuất thô có thể được truyền luồng trực tiếp vào các kho dữ liệu như Snowflake, Google BigQuery hoặc Amazon Redshift bằng cách sử dụng webhook S2S hoặc các bộ tải đường ống lưu trữ tệp phẳng theo lịch trình.
Dữ liệu xuất thô có thể thay thế các bảng điều khiển phân bổ di động không?
Không. Dữ liệu xuất thô không thay thế các bảng điều khiển phân bổ. Chúng bổ sung cho các bảng điều khiển tóm tắt bằng cách cho phép các kết nối SQL tùy chỉnh, kiểm toán nhóm lịch sử dài hạn và tích hợp Data Clean Room.
Sự khác biệt giữa luồng nhật ký S2S thời gian thực và tệp xuất CSV hàng ngày là gì?
Tệp xuất CSV hàng ngày cung cấp các đợt bản ghi cấp sự kiện theo lịch trình, trong khi các luồng S2S cung cấp khả năng phân phối có độ trễ thấp hơn khi các sự kiện được xử lý.
Việc xuất dữ liệu thô hỗ trợ quyền sở hữu dữ liệu và tuân thủ quyền riêng tư như thế nào?
Việc xuất dữ liệu thô chuyển dữ liệu từ xa sự kiện chưa tổng hợp trực tiếp vào cơ sở hạ tầng cơ sở dữ liệu nội bộ của bạn, cho phép bạn thực thi các chính sách lưu trữ dữ liệu nội bộ, thực hiện xóa tuân thủ quyền riêng tư và loại bỏ sự phụ thuộc vào báo cáo tổng hợp.

Những điểm chính cần nhớ

  • Kiểm soát lưu trữ trực tiếp: Xuất dữ liệu thô chưa tổng hợp chuyển toàn bộ dữ liệu từ xa cấp sự kiện trực tiếp vào kho dữ liệu, đảm bảo sự minh bạch kiểm toán hoàn toàn.

  • Phân tích không giới hạn: Nhật ký sự kiện thô cho phép đội ngũ dữ liệu thực hiện các truy vấn SQL tùy chỉnh, thực hiện kết hợp nhóm phức tạp với dữ liệu CRM và tránh các hạn chế lấy mẫu của bảng điều khiển báo cáo tổng hợp.

  • Đồng bộ hóa đường ống: Tiếp nhận các luồng S2S thô hoặc tệp CSV phẳng đã chuẩn hóa hàng ngày cho phép các đường ống ETL tự động duy trì báo cáo BI nhất quán và đáng tin cậy.

Tóm tắt và khung quyết định

Để thực hiện phân tích giữ chân nhóm nâng cao, các kiến trúc phân tích di động thường kết hợp báo cáo bảng điều khiển với các đường ống dữ liệu thô cấp sự kiện. Việc xuất nhật ký cấp sự kiện cho phép đội ngũ kỹ thuật dữ liệu thực hiện các truy vấn SQL tùy chỉnh, kết hợp dữ liệu từ xa phân bổ với cơ sở dữ liệu giao dịch nội bộ và duy trì quyền kiểm soát lưu trữ trực tiếp trong các hệ thống dữ liệu nội bộ.

Hướng tới các quy định bảo mật trong tương lai, việc sở hữu các luồng sự kiện thô vẫn rất cần thiết để xây dựng các mô hình đo lường kết hợp và tích hợp Data Clean Room. Bằng cách kết hợp dữ liệu từ xa SDK nhẹ với luồng dữ liệu thô, các nền tảng đo lường cung cấp cơ sở hạ tầng cần thiết để duy trì sự minh bạch kiểm toán và thúc đẩy phân tích nhóm người dùng chi tiết.

Các nhà phát triển triển khai các đường ống phân bổ di động có thể tham khảo tài liệu SDK phân bổ di động hoặc đăng ký tài khoản trên bảng điều khiển dành cho nhà phát triển Openinstall để biết quy trình tích hợp SDK và phân phối sự kiện.

Chủ đề liên quan

Share this article