明明都是具有RSS訂閱的網站,為何瀏覽器會有偵測不到的問題呢?其實差別在於網站原始碼<head>標籤內是否具有<link>標籤。
2010年9月2日 星期四
2010年8月9日 星期一
自動抓取 Html 的網站編碼
我之前是設計使用者在輸入網址時,也必須輸入網站編碼,但除非從瀏覽器的工作列上選擇「檢視」-> 「編碼」來查看,不然一般使用者是不會在乎網站的編碼,反正能正常顯示就好。於是我必須要加入自動偵測的方式,代替使用者輸入網站編碼。
2010年7月22日 星期四
放棄 Neko HtmlParser ,改用 Cobra HtmlParser 解析網頁
之前發佈的文章 使用 Neko HtmlParser 產生 Html DOM ,發現到 Neko HtmlParser 經常發出:
Exception in thread "main" org.w3c.dom.DOMException:
HIERARCHY_REQUEST_ERR:
An attempt was made to insert a node where it is not permitted.
Exception in thread "main" org.w3c.dom.DOMException:
HIERARCHY_REQUEST_ERR:
An attempt was made to insert a node where it is not permitted.
2010年7月18日 星期日
利用 Xpath( Xml Path Language XML查詢語言)來達到搜索功能
雖然我們學會了 Xml DOM 與 Html DOM ,但當 DOM 內容龐大時,要如何找出我們所需的節點內容呢?此時就能使用 Xpath( Xml Path Language XML查詢語言)來達到快速查詢的功能。
Xpath 本身就是一種 Xml 技術的查詢語言,在1999年11月16日成為 W3C 的建議規格,我們可利用 Xpath 查詢語言與運算式當作搜索條件,由於 Xpath 語言內容較為簡單,故在此就不再多作敘述,有興趣可查詢參考資料的內容。以下為 Java 使用 Xpath 的程式碼:
Xpath 本身就是一種 Xml 技術的查詢語言,在1999年11月16日成為 W3C 的建議規格,我們可利用 Xpath 查詢語言與運算式當作搜索條件,由於 Xpath 語言內容較為簡單,故在此就不再多作敘述,有興趣可查詢參考資料的內容。以下為 Java 使用 Xpath 的程式碼:
使用 Neko HtmlParser 產生 Html DOM
這次專題所選用的 HtmlParser 是採用有點歷史的 Neko HtmlParser + xerces ,其中 Neko 作者本身是 IBM 的 xerces 團隊的主力開發者,對 DOM 解析領域相當精深,再加上 Neko HtmlParser 具有不錯的 Html 標籤解析與清理效果。雖然我在最近一個禮拜尋找與測試其他的解析器,例如最多人使用的 HtmlParser 以及較為冷門的 Cobra HtmlParser ,但仔細比較之後,還是 Neko HtmlParser 較為好用。
2010年6月18日 星期五
使用DTD的方式定義RSS標籤
雖然RSS的所有標籤即便不使用DTD定義,也可讓瀏覽器與RSS閱覽器正常運作,但在使用 DOM Parser 載入檔案時,會讀取到空白符號,若堅持不使用DTD文件認證,則在編輯XML時會十分不便。
2009年11月29日 星期日
Cookie的使用心得
雖然Cookie提供類似跨網頁的全域性變數功能,但實際使用上卻有許多限制,像是使用setcookie()來儲存變數時,必須要在<html>標籤之前就先行設定,否則$_COOKIE[]內的數值將無法更改。(雖然參考書籍中提到可用ob_start buffering的語法設定,但內文沒有提到詳細語法使用,暫且不討論。)
訂閱:
文章 (Atom)