笔趣阁

繁体 | 简体
笔趣阁 > 重生1996:我教黄老板做显卡 > 第13章 想见我?排队去吧!

第13章 想见我?排队去吧!(3/5)

Sergeyb在帖子里绝望地提问:

“如果存在一个网页群,它们内部互相疯狂链接,但完全不链接外部的任何网页。

这种‘蜘蛛陷阱(Spider trap)’会导致我们的权重计算陷入死循环,算法的收敛性被彻底破坏了。

谁有解决思路?”

下面跟了几十条回复。

全是一些高校学生的瞎猜,什么“限制链接层数”、“人工审核过滤”。

根本没答到点子上。

林哲看着屏幕,差点笑出声。

“就这啊?”

五十多岁、在未来硅谷看了三十年技术迭代的老妖怪林哲,看着这俩未来互联网大帝在这愁眉苦脸,感觉就像在看两个小学生做不出两位数的加减法。

“蜘蛛陷阱?”

“这玩意在2000年以后连大一的计算机考试都不考了。”

林哲把嘴里的饼干渣咽下去,然后活动了一下十指。

“让大爷来教教你们什么叫降维打击。”

手指飞舞,键盘被敲得劈啪作响。

林哲直接在回复框里开始输出。

没有任何铺垫,不打任何招呼,直接甩干货。

“关于你们的死循环问题,思路从一开始就太死板了。”

“不要把爬虫当成一台只会顺着线走的机器。”

“引入‘随机冲浪者模型(Random Surfer model)’。”

林哲面无表情地打字。

“假设一个无聊的网民在上网,他有85%的概率顺着网页上的链接点下去。

但是!

他有15%的概率会突然觉得没意思,直接在地址栏输入一个全新的网址,跳出当前的圈子。”

“给算法加一个阻尼系数(damping Factor),设为0.

85。”

“只要加上这15%的随机跳转概率,所谓的‘蜘蛛陷阱’就会瞬间被打破。

死循环永远无法形成,权重计算立刻就能收敛。”

写完这段,林哲想了想。

光给答案不够刺激,还得再鄙视他们一下。

他又加了一段。

“另外,只看链接数量太粗糙了。

你们早晚会遇到垃圾网站作弊的问题。”

“引入‘trustRank(信任指数)’,选一批绝对权威的种子网站(比如大学、政府官网)。

离这些种子网站越近的链接,权重才越高。

那些互相链接的垃圾站,直接把它们的权重降成狗屎。”

“还有,别忘了把文本的‘tF-IdF(词频-逆文档频率)’结合进去。

光看链接不看内容,搜出来的全是标题党。”

“思路打开点,两位同学。”

写完。
本章未完,请翻下一页继续阅读.........
『加入书签,方便阅读』