顯示具有 HTML 標籤的文章。 顯示所有文章
顯示具有 HTML 標籤的文章。 顯示所有文章

2010年9月2日 星期四

瀏覽器自動偵測網站是否具有RSS訂閱

明明都是具有RSS訂閱的網站,為何瀏覽器會有偵測不到的問題呢?其實差別在於網站原始碼<head>標籤內是否具有<link>標籤。

2010年8月9日 星期一

自動抓取 Html 的網站編碼

我之前是設計使用者在輸入網址時,也必須輸入網站編碼,但除非從瀏覽器的工作列上選擇「檢視」-> 「編碼」來查看,不然一般使用者是不會在乎網站的編碼,反正能正常顯示就好。於是我必須要加入自動偵測的方式,代替使用者輸入網站編碼。

2010年7月22日 星期四

放棄 Neko HtmlParser ,改用 Cobra HtmlParser 解析網頁

之前發佈的文章 使用 Neko HtmlParser 產生 Html DOM ,發現到 Neko HtmlParser 經常發出:

Exception in thread "main" org.w3c.dom.DOMException:
HIERARCHY_REQUEST_ERR:
An attempt was made to insert a node where it is not permitted.

2010年7月18日 星期日

利用 Xpath( Xml Path Language XML查詢語言)來達到搜索功能

雖然我們學會了 Xml DOM 與 Html DOM ,但當 DOM 內容龐大時,要如何找出我們所需的節點內容呢?此時就能使用 Xpath( Xml Path Language XML查詢語言)來達到快速查詢的功能。

Xpath 本身就是一種 Xml 技術的查詢語言,在1999年11月16日成為 W3C 的建議規格,我們可利用 Xpath 查詢語言與運算式當作搜索條件,由於 Xpath 語言內容較為簡單,故在此就不再多作敘述,有興趣可查詢參考資料的內容。以下為 Java 使用 Xpath 的程式碼:

使用 Neko HtmlParser 產生 Html DOM

這次專題所選用的 HtmlParser 是採用有點歷史的 Neko HtmlParser + xerces ,其中 Neko 作者本身是 IBM 的 xerces 團隊的主力開發者,對 DOM 解析領域相當精深,再加上 Neko HtmlParser 具有不錯的 Html 標籤解析與清理效果。雖然我在最近一個禮拜尋找與測試其他的解析器,例如最多人使用的 HtmlParser 以及較為冷門的 Cobra HtmlParser ,但仔細比較之後,還是 Neko HtmlParser 較為好用。

2010年6月18日 星期五

使用DTD的方式定義RSS標籤

雖然RSS的所有標籤即便不使用DTD定義,也可讓瀏覽器與RSS閱覽器正常運作,但在使用 DOM Parser 載入檔案時,會讀取到空白符號,若堅持不使用DTD文件認證,則在編輯XML時會十分不便。

2009年11月29日 星期日

Cookie的使用心得

雖然Cookie提供類似跨網頁的全域性變數功能,但實際使用上卻有許多限制,像是使用setcookie()來儲存變數時,必須要在<html>標籤之前就先行設定,否則$_COOKIE[]內的數值將無法更改。(雖然參考書籍中提到可用ob_start buffering的語法設定,但內文沒有提到詳細語法使用,暫且不討論。)