名單丟進去,它逐筆爬完對方的官網與定價頁,判斷這家公司是不是值得花時間的客戶, 然後把名單自動分成四堆:談得成的、有風險的、不合的、判不出來的。
這是其中最完整的一條,26 個節點。 客戶要的是「別再讓業務一家一家點開網站看」,所以整條的設計重點不是爬得快,是判斷要可信、而且壞掉要看得見。
從試算表把原始名單讀進來,先擋掉沒有網址或沒有聯絡方式的 —— 那些爬了也沒用,白花錢。
一次處理一批,把網址送進自架的爬取服務。用自架的而不是買現成的,是因為量大的時候按次計費會失控。
爬一個網站要幾十秒,不能站在那裡等。改成拿一個任務編號、隔一段時間回來問一次,問到好為止。
只餵首頁與定價頁給模型,要它回一個 1–10 分。判準寫得很死:目標是每筆兩萬五美金以上的 B2B 軟體公司,同時明列十一種不要的類型(電商、行銷工具、人力派遣、政府案…), 月費低於 250 美金的直接三分以下。
模型有時回陣列、有時回物件、有時什麼都沒回。這一段把三種形狀都接住, 接不住就給一組空值往下走 —— 一筆壞掉不能讓整條產線停下來。
高分的進「可談」、有疑慮的進「風險名單」、明確不合的進「排除」、 模型沒給分的另外開一堆。第四堆是刻意留的 —— 判不出來跟判定不合是兩件事, 混在一起就永遠不知道系統漏了多少。
整條掛一個獨立的錯誤流程,任何一個節點爆掉就發一則到 Discord。 沒有這一段,自動化最常見的死法是它安靜地停了三天而沒有人發現。
同一份名單,一套走託管服務、一套走自架,並行跑再比對結果。 目的是量出「自架省下的錢值不值得多花的維護時間」。
爬完的網頁轉成結構化欄位再落表,25 個節點。這是整批裡最早交付的一條。
整頁轉 Markdown、用 AI 抽欄位、照 CSS 結構抽 —— 三種在同一條流程裡並排, 量哪一種在哪種網站上比較準。
把爬取服務自己架起來,五種呼叫方式(單頁、探索、搜尋、整站、AI 抽取)全部接通。
雲端硬碟的文件切塊、轉向量、存進向量資料庫,接成一個問得動的問答。
同一條主線的七個版本,從 28 個節點收斂到 26 個。 後面的版本比前面短 —— 那是把三次踩到的坑收進更少的判斷裡。
要看真的東西:17 條流程的原始檔 —— 可直接匯入 n8n,金鑰、客戶名與內部位址已全部移除。