十一月一号,周一。
炜杰站在新办公室的窗前,看着中关村大街上的梧桐树。叶子已经黄了大半,风一吹,纷纷扬扬地落下来,铺在地上像一层碎金。
倒计时十五天。
何明的爬虫爬到了五十万个网页。分布式架构跑稳定了,三台服务器昼夜不停地运转,硬盘灯一闪一闪,像三颗同步跳动的心脏。
刘芳的索引系统做了第三次升级。五十万网页的检索响应时间,平均2.1秒。她还加了一个简单的排序算法——基于关键词出现频率和网页被引用次数的综合权重。
王志远的分词团队做出了第一版中文分词系统。词典容量五万个词,支持未登录词的识别,准确率比正向最大匹配提升了将近一倍。
何明把这四个模块拼在一起——爬虫、分词、索引、排序——做成了一个能用的产品。他给这个产品起了一个名字:
"找得到"
和炜杰的公司名一样。
十一月五号,炜杰做了一次内部演示。
他把所有人召集到新办公室的大厅里——十六个人,站成一排,面前是一张从复印店借来的折叠桌,上面放着一台显示器。
炜杰在搜索框里输入了三个字:
中关村。
回车。
2.3秒后,屏幕上列出了十条搜索结果。第一条是中关村电子市场的介绍页面,第二条是海龙大厦的招商信息,第三条是一篇关于中关村科技园区的新闻报道。
"相关性怎么样?"炜杰问。
"比搜狐强。"何明说,"搜狐搜'中关村',前三条里有一条是卖电脑配件的广告。我们没有广告。"
"比新浪呢?"
"新浪的搜索结果里有两条404。"小陈说,"我们一条都没有。"
炜杰又输入了一组关键词:
搜索引擎 技术。
回车。
这一次,第一条结果是何明在北大BBS上发表的技术帖,第二条是刘芳写的一篇关于索引优化的文章,第三条是一篇翻译自美国的关于Google的科普文章。
"这个好。"炜杰说,"我们自己的内容排到了前面。"
"因为关键词匹配度高。"王志远说,"'搜索引擎'和'技术'这两个词,在我们的索引库里,何明和刘芳的文章是匹配度最高的。"
炜杰点点头。
他转过身,看着面前这十六个人。
本章未完,请点击下一页继续阅读!