跳至主要內容

內容與發現

對手上新,當週就知道

監察競爭對手,先是授權問題,其次才是技術問題。Meta 訂明自動化資料收集需要事先取得書面許可,所以 Instagram 爬蟲在這裡不是選項,有文件的介面才是。剩下可用的範圍,比一般說法窄:經 business_discovery 讀取對手的公開專業帳號、廣告資料庫願意返回的廣告、在對方網站條款與 robots.txt 容許範圍內讀取的自家頁面,以及對方主動寄給你的通知。窄而合規,好過闊而被追究。

觸發
兩個
執行頻率
每日一次
工具
4 件
需要 durable execution
不需要

流程

上面那條只讀取你獲准讀取的來源,並保留一份有日期的副本。下面那條負責比對,然後由一條門檻決定要不要驚動人。

編排

每朝一次

n8n 排程

平台

讀取獲准的來源

Instagram Graph API · Ad Library API

資料

存起今日這一份

Sheets · Airtable

編排

收到對方的通訊

n8n · Make

編排

與昨日比對

n8n

編排

有新品或減價嗎?

n8n IF

通知

通知負責定價的人

Slack · WhatsApp

編排

維持原檔

逐步拆解

  1. 01

    每朝一次

    n8n 排程

    一日一次。上新是以星期為單位的事件,查得更密不會多知道什麼,反而開始像條款禁止的那種行為。

  2. 02

    讀取獲准的來源

    Instagram Graph API · Ad Library API

    經 business_discovery 讀對手的專業帳號、經廣告資料庫介面讀他們的廣告,以及只在該網站條款與 robots.txt 容許的前提下讀取他們自己的產品頁。任何需要登入的內容,以及任何條款禁止自動收集的平台,都不在清單之內——包括這些介面以外的 Instagram 本身。

  3. 03

    存起今日這一份

    Sheets · Airtable

    每個來源每日一行,行上註明來源。價值會累積:一年的資料會顯示他們多久上新一次、如何定價,而單次讀取永遠給不到這些。

  4. 04

    收到對方的通訊

    n8n · Make

    第二個來源,而且是對方希望你收到的那個。把它導入同一個比對,而不是導入一個資料夾,讓它與昨日的紀錄核對,而不是被略讀一次。

  5. 05

    與昨日比對

    n8n

    逐個欄位跟上一行比。比的是數值,不是頁面——改版不是上新;一個分不清兩者的流程,會一直發假警報,直到被人靜音。

  6. 06

    有新品或減價嗎?

    n8n IF

    設一條門檻。現有產品多一個顏色不算上新,四捨五入的差額不算減價。這條門檻是關於你所處類別的判斷,也是這個流程裡唯一抄不到的部分。

  7. 07

    通知負責定價的人

    Slack · WhatsApp

    寫明產品、舊價與新價、首次發現的日期,以及來源。來源最重要:對方無法自行覆核的說法不算情報,只是一則有時間戳的傳聞。

平台不容許的事

這一個案例,限制本身就是設計。要在決定做不做之前讀完,不是做完之後。

  • 「You will not engage in Automated Data Collection without first obtaining Meta's express written permission or in any manner that is not explicitly authorized by Meta.」所以爬取對手的 Instagram 或 Facebook 內容並不可行。這個流程只透過下面列出的有文件介面讀取 Meta。

    Meta — Automated Data Collection Terms
  • business_discovery 是讀取另一個 Instagram 商業或創作者帳號的有文件方法,返回追蹤人數、內容數目、各則內容互動等公開欄位。「Data about age-gated Instagram Business IG Users will not be returned」,並需要 instagram_basic、instagram_manage_insights 與 pages_read_engagement 權限。對手如果用個人帳號,就完全不在範圍之內。

    Instagram Platform — IG User business_discovery
  • 廣告資料庫介面返回「archived ads from the Meta Ad Library based on keyword searches of text, images, audio from video, and the call-to-action button」,但「ads that did not reach any location in the EU will only return if they are about social issues, elections or politics」。對手如果只在亞洲投放,這個來源大致上會是空的——而這與一般描述剛好相反。

    Meta Graph API — ads_archive (Ad Library API)
  • robots.txt 讓「service owners control how content served by their services may be accessed, if at all, by automatic clients」,而該 RFC 明確寫著「these rules are not a form of access authorization」。沒有被 Disallow 的路徑,仍然受該網站條款規管;robots.txt 只說明爬蟲可以去哪裡,從來不代表你獲准去那裡。

    RFC 9309 — Robots Exclusion Protocol
  • 小紅書公開的 API 文件涵蓋的是商家操作——訂單、商品、庫存、物流——當中沒有讀取其他品牌筆記的介面,我們亦找不到任何公開條款容許自動收集。這一邊維持人手處理:由人按時去查。

    小紅書開放平台 — API 文件導覽

什麼情況不值得做

以下三種情況,維護成本會高於被突襲的代價。

  • 你只有一個對手,而且他們每次都會通知一份你已經訂閱的名單。訂閱本身就是整個流程,其餘只是圍住一封電郵的裝飾。

  • 你就算知道,一星期之內也做不了任何事。售價由合約決定、存貨提前一季下單,早知道只會延長你束手無策的時間。

  • 答案只存在於登入之後,或者存在於一個條款禁止自動收集的平台。誠實的做法是由人按時去查;一個假裝不是這樣的流程,為了一星期省十分鐘而製造法律風險。

延伸閱讀

聯絡我們

這些流程,你真正應該做哪一條?

我們每星期都在為香港的營運團隊跑這些流程。告訴我們哪個環節正在耗你的時間,我們會告訴你自動化划不划得來。

開始對談