Sergeyb在帖子里绝望地提问:
“如果存在一个网页群,它们内部互相疯狂链接,但完全不链接外部的任何网页。
这种‘蜘蛛陷阱(Spider trap)’会导致我们的权重计算陷入死循环,算法的收敛性被彻底破坏了。
谁有解决思路?”
下面跟了几十条回复。
全是一些高校学生的瞎猜,什么“限制链接层数”、“人工审核过滤”。
根本没答到点子上。
林哲看着屏幕,差点笑出声。
“就这啊?”
五十多岁、在未来硅谷看了三十年技术迭代的老妖怪林哲,看着这俩未来互联网大帝在这愁眉苦脸,感觉就像在看两个小学生做不出两位数的加减法。
“蜘蛛陷阱?”
“这玩意在2000年以后连大一的计算机考试都不考了。”
林哲把嘴里的饼干渣咽下去,然后活动了一下十指。
“让大爷来教教你们什么叫降维打击。”
手指飞舞,键盘被敲得劈啪作响。
林哲直接在回复框里开始输出。
没有任何铺垫,不打任何招呼,直接甩干货。
“关于你们的死循环问题,思路从一开始就太死板了。”
“不要把爬虫当成一台只会顺着线走的机器。”
“引入‘随机冲浪者模型(Random Surfer model)’。”
林哲面无表情地打字。
“假设一个无聊的网民在上网,他有85%的概率顺着网页上的链接点下去。
但是!
他有15%的概率会突然觉得没意思,直接在地址栏输入一个全新的网址,跳出当前的圈子。”
“给算法加一个阻尼系数(damping Factor),设为0.
85。”
“只要加上这15%的随机跳转概率,所谓的‘蜘蛛陷阱’就会瞬间被打破。
死循环永远无法形成,权重计算立刻就能收敛。”
写完这段,林哲想了想。
光给答案不够刺激,还得再鄙视他们一下。
他又加了一段。
“另外,只看链接数量太粗糙了。
你们早晚会遇到垃圾网站作弊的问题。”
“引入‘trustRank(信任指数)’,选一批绝对权威的种子网站(比如大学、政府官网)。
离这些种子网站越近的链接,权重才越高。
那些互相链接的垃圾站,直接把它们的权重降成狗屎。”
“还有,别忘了把文本的‘tF-IdF(词频-逆文档频率)’结合进去。
光看链接不看内容,搜出来的全是标题党。”
“思路打开点,两位同学。”
写完。
本章未完,请翻下一页继续阅读.........