AI 回答時為什麼不引用我的網站?
Perplexity、ChatGPT 搜尋、Gemini 回答時都會附上來源連結。如果你的網站從來沒出現在那些連結裡,通常不是因為內容寫得不夠好 —— 而是它在更前面的關卡就被排除了。
立即免費檢測 ↓第一關:爬蟲進不進得來
這是最常被忽略、也最容易修的一關。robots.txt 擋掉 AI 爬蟲、網站對非瀏覽器 User-Agent 回傳錯誤、或整站需要登入才看得到內容,都會讓你在第一步就出局。
有一個很諷刺的狀況我們遇過不只一次:公司為了防止內容被抓取而封鎖爬蟲,結果同時也把 AI 擋在門外,然後抱怨 AI 都不提到自己。
- robots.txt 是否放行 GPTBot、ClaudeBot、PerplexityBot、Google-Extended
- sitemap.xml 是否存在且回傳的是 XML 而不是網頁
- 對爬蟲的 User-Agent 是否會被防護機制擋掉
第二關:讀不讀得懂
爬蟲進得來,不代表讀得到內容。如果首屏內容完全靠 JavaScript 才渲染,部分爬蟲拿到的是一個空殼。關鍵資訊放在圖片、PDF、影片裡也是同樣的結果。
另一個常見問題是全站共用同一組 title 與 description。對搜尋引擎而言那代表這些頁面沒有差異,自然不會被分別引用。
第三關:敢不敢用
模型引用來源時會考慮可信度。沒有作者、沒有日期、沒有任何第三方佐證的頁面,即使內容正確也可能被略過 —— 因為它無法判斷這是不是可靠資訊。
加上 Schema.org 結構化資料(Organization、Article、FAQPage)之所以有效,不是因為有什麼魔法,而是它明確告訴機器「這頁是什麼、誰寫的、什麼時候寫的」,把判斷成本降到最低。
第四關:值不值得引用
前三關都過了,最後比的才是內容本身。模型偏好引用「能直接回答問題的段落」。一篇八百字鋪陳才進入重點的文章,比不上一段直接把答案寫清楚的 FAQ。
實務上最有效的做法,是把客戶真的會問的問題當成標題,然後在第一段就把答案講完。這既符合模型的引用習慣,對真人讀者也比較友善。
FAQ
放行 AI 爬蟲,我的內容會不會被拿去訓練?
會,這是取捨。如果你的商業模式是靠內容本身收費,封鎖是合理的;如果你希望被更多人找到,那麼被讀取正是前提。多數中小企業屬於後者,卻套用了前者的設定。
我的網站是用網站建置平台做的,改得動這些嗎?
大部分改得動。robots.txt、頁面標題描述、結構化資料在主流平台都有設定入口,只是位置比較隱蔽。真正改不動的通常是「內容全部做成圖片」這件事,那需要重新編排內容。
要多久才看得到效果?
爬蟲層的修正(robots、sitemap、可讀性)通常數天到數週就會反映在即時搜尋型的 AI 上。內容與第三方背書的累積則以月為單位。