<?xml version="1.0" encoding="gb2312"?>

<!-- RSS generated by oioj.net on 4/16/2004 ; 感谢LeXRus提供 RSS 2.0 文档; 此文件可自由使用，但请保留此行信息 --> 
<!-- Source download URL: http://blogger.org.cn/blog/rss2.asp       -->
<rss version="2.0">

<channel>
<title>liangbin的博客</title>
<link>http://blogger.org.cn/blog/blog.asp?name=liangbin</link>
<description>liangbin的博客</description>
<copyright>blogger.org.cn</copyright>
<generator>W3CHINA Blog</generator>
<webMaster>webmaster@blogger.org.cn</webMaster>
<item>
<title><![CDATA[说说价值观]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=46965</link>
<author>liangbin</author>
<pubDate>2009/8/30 21:25:03</pubDate>
<description><![CDATA[<P>&nbsp;&nbsp;我一直打算写这样一篇文章来说说价值观，但总感觉不是时候，理不出头绪，昨天公司邀请新浪教育频道编辑唐晓芸给我们做一个讲座。</P>
<P>&nbsp;&nbsp;&nbsp; 整个讲座就是一个价值观的输出，让在场的所有人感到震撼，对新浪的工作肃然起敬，而我曾在sohu从事新闻的人来说，仿佛从回到那种熟悉的战壕中。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;在讲座的中途，唐老师问大家是否看过《新浪之道》，我不仅回答了本书的作者，出版社还包括出版时间，唐老师问我有什么感想，我说了这么一句话，看完本书后，我感觉到是陈彤先生输出了他的以及新浪的价值观，令人尊敬。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;什么是价值观呢？今天我也很难用简练的语言来回答，但可以通过一些例子来理解。</P>
<P>&nbsp;&nbsp;&nbsp;（1）当一天产生出数万的新闻时，你把那一条放在推荐的位置上，而把那一条忽视掉。</P>
<P>&nbsp;&nbsp;&nbsp;（2）当你拿到了一个爆炸性的新闻时，你是去求证一下真实性，还是直接发出，能抢一点时间，就抢一点时间。</P>
<P>&nbsp;&nbsp;&nbsp;（3）当你很有成就了，你是帮助他人，提高行业水平，还是孤芳自赏。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;(4）当你默默无闻的时候，你是要把工作做得让自己满意，还是让领导满意，还是放眼世界，让世界震撼。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;每天我们都能看到过去的新闻点击率的情况，我们知道哪些新闻是大众爱看的，哪些标题是吸引人的，但为什么并不是所有的这些新闻都放在了浪首（或者狐首）上，很有意思的是，新浪称浪首，而sohu称狐首。</P>
<P>&nbsp;&nbsp;&nbsp; 当我们总是不加求证就乱发新闻，新闻的公信力就失去了，快但却是假新闻，得不偿失。</P>
<P>&nbsp;&nbsp;&nbsp; 当我们做得很好，或者有起色，是不是每个人都能像陈彤一样写一本《新浪之道》呢？</P>
<P>&nbsp;&nbsp;&nbsp; 当我们自以为是的时候，有没有看一看领导的眼色，有没有看一看全行业的眼色，有没有看看用户是否都满意了，大部分的时候我们都做得不够，远远不够。</P>
<P>&nbsp;&nbsp;&nbsp; 价值观是最能打动人，最能征服人的，一个企业，一个产品，甚至是一个人，都透射出深深的价值观，取舍，严谨，主动，自省，我想还有很多很多，优秀的东西才能传承，这种感觉每每在看到祖先留传给我们的精美艺术品时都能感觉到。</P>
<P>&nbsp;&nbsp;&nbsp; 今天，我写了一本《走进搜索引擎》，翻译了一本《深入搜索引擎》，这都是在条件异常艰苦的情况下完成的，在写《走进搜索引擎》的时候条件异常艰苦，每天工作到很晚，不是赶进度，对我来说，从来没有进度，而是在阅读大量的论文，在构思写作的方法，每次走出实验室，我都用力举起双手，给自己鼓励，激励自己坚持下去。在写《深入搜索引擎》的时候更加的艰难，工作常常加班，只能利用周六和周日，难度可想而知，很多地方我都要反复看很多遍，确保自己充分理解，并参考大量论文来进行理解，而这一本书的效益对我来说就是一个月的工资，如果为了稿费，完全没必要如此，这样努力一方面是因为本书作者的价值观打动了我，他们这种积极分享知识的价值观让我无论如何也要把它带到中国，让更多的国人知道这些，另外我也要通过这本书来量出我的能力，终于我征服了它。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; </P>
<P>&nbsp;&nbsp;&nbsp; 美好的结果，总是在努力之后的，我还要继续努力，永不停止。</P>
<P><BR>本文来自CSDN博客，转载请标明出处：<A href="http://blog.csdn.net/pennyliang/archive/2009/08/30/4500443.aspx">http://blog.csdn.net/pennyliang/archive/2009/08/30/4500443.aspx</A></P>]]></description>
</item><item>
<title><![CDATA[大规模数据处理漫谈【4】]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=46109</link>
<author>liangbin</author>
<pubDate>2009/6/20 9:15:09</pubDate>
<description><![CDATA[<P>我们会看到这样的源代码</P>
<P>&nbsp;&nbsp;&nbsp; bool dosomething(int&amp; count,int&amp; sum)<BR>&nbsp;&nbsp; {<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; if (likely(count&lt;sum)) {<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; if (unlikely(count&lt;ZERO))</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; {<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; print_error(LESSTHANZERO);</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; return false;</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; }<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; count++;<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; }</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; return true;<BR>&nbsp;&nbsp; }<BR>&nbsp;&nbsp; 这个likely和unlikely是什么呢？我们称之为分支预测提示，便于指令预取。</P>
<P>&nbsp;&nbsp; 在 Linux 内核中最常用的优化技术之一是 __builtin_expect。在开发人员使用有条件代码时，常常知道，最可能执行哪个分支，而哪个分支很少执行。如果编译器知道这种预测信息，就可以围绕最可能执行的分支生成最优的代码。</P>
<P>&nbsp;&nbsp; 如下所示，__builtin_expect 的使用方法基于两个宏 likely 和 unlikely（见 ./linux/include/linux/compiler.h）。 </P>
<P>#define likely(x) __builtin_expect(!!(x), 1)<BR>#define unlikely(x) __builtin_expect(!!(x), 0)</P>
<P>&nbsp;&nbsp; 或者还会看到这样的源代码</P>
<P>&nbsp;&nbsp; for (size_t i=0; i&lt;cnt; i+=8)<BR>&nbsp; {<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; buffer[i] = value;<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; buffer[i+1] = value;<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; ......<BR>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; buffer[i+7] = value;<BR>&nbsp; }</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 为什么要进行循环展开呢？</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 要理解这两块代码，就必须了解CPU指令流水线，下面将展开讨论，最后回顾这两个例子，给出编码的一些指导思想。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 减少CPU指令集中每条指令所需的时间就能最大程度发挥CPU的效用，虽然有些是软件工程师无法控制的，但理解这些特性，能够是程序更加面向这种硬件的设计，从而获得优化的回报。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 精简指令计算机（RISC）处理器的设计目标就是平均每个时钟周期执行一条指令，虽然RISC是精简的但执行一条指令还需要多个步骤（需要多个时钟周期），怎么可能做到每周期执行一条指令呢？</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 答案是并行。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 我们考察这样一个简单的指令</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; mov([ebx],eax)需要经过的步骤</P>
<P>&nbsp;&nbsp;&nbsp; （1）从内存中获取指令的操作码（即这个mov指令）</P>
<P>&nbsp;&nbsp;&nbsp; （2）更新EIP寄存器，将其值改为紧随操作码之后的字节的地址（例如指令流中mov的下一个指令是jnz，则EIP的值指向jnz这个指令的地址。</P>
<P>&nbsp;&nbsp;&nbsp; （3）对操作码进行解码，得到指定的指令（mov必须翻译成机器可以执行的指令）</P>
<P>&nbsp;&nbsp;&nbsp; （4）从原寄存器中取值（从ebx寄存器中取值）</P>
<P>&nbsp;&nbsp;&nbsp; （5）将值存储到目标寄存器中（写入eax寄存器中）</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 当然这里由于都是寄存器间的操作，因此步骤比较简单，更复杂的，如果操作数来自于内存，EIP寄存器还需要进一些变化，操作码+操作数+操作码，也就是说EIP需要知道操作数的长度，才能知道下一个操作码的位置。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 这不打算展开讨论，我们来看一个基本的流水线实现。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 假定一个6级流水，定义为</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; </P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; 取操作码&nbsp; 解码操作码（并预取操作数） 计算有效地址&nbsp; 获取地址值&nbsp;&nbsp; 计算 存入结果</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; </P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; 我们来看这样一个时钟周期和指令执行的过程，假定都可以并行执行（后面我们会讨论流水线停滞）</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; T1&nbsp;&nbsp;&nbsp; T2&nbsp;&nbsp; T3&nbsp;&nbsp;&nbsp; T4&nbsp;&nbsp;&nbsp; T5&nbsp;&nbsp;&nbsp; T6&nbsp;&nbsp;&nbsp;&nbsp; T7&nbsp;&nbsp;&nbsp; T8&nbsp;&nbsp;&nbsp; T9&nbsp;&nbsp;&nbsp; T10&nbsp;&nbsp; T11&nbsp; T12</P>
<P>指令1，7&nbsp;&nbsp; 取码&nbsp; 解码&nbsp; 取址&nbsp; 取值&nbsp;&nbsp; 计算 存值&nbsp; 取码&nbsp; 解码&nbsp; 取址&nbsp; 取值&nbsp; 计算 存值 </P>
<P>指令2&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 取码&nbsp; 解码&nbsp; 取址&nbsp;&nbsp; 取值&nbsp; 计算 存值</P>
<P>指令3&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 取码&nbsp; 解码&nbsp;&nbsp; 取址&nbsp; 取值&nbsp; 计算 存值</P>
<P>指令4&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 取码&nbsp;&nbsp; 解码&nbsp; 取址&nbsp; 取值&nbsp; 计算&nbsp; 存值</P>
<P>指令5&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 取码&nbsp; 解码&nbsp; 取址&nbsp; 取值&nbsp; 计算 存值</P>
<P>指令6&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 取码&nbsp; 解码&nbsp; 取址&nbsp; 取值&nbsp; 计算&nbsp; 存值</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 理想的情况下，我们看到，在T1到T6这6个时间段中，流水线被打满，前6个指令依次装入流水线。从生产结果的情况看，从T6开始流水线做完了指令1，T7做完了指令2，......T11做完了指令6，T12时刻完成了指令7，产生了轮回。这样就呈现出（从头T6开始）每周期执行一条指令的态势，这一切都是并发指令带来的结果。</P>
<P>&nbsp;&nbsp;&nbsp; </P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; 但我们不难理解在执行某个指令时，必须要能够正确地猜测出下一个指令的位置，才有可能进行正确的预取，一次错误的猜测会导致整个流水线毁掉，重新初始化。因此我们看到了此前的第一个例子中，编码过程中告诉编译器那一个指令更有可能是下一条指令，而在最大程度上避免了犹豫猜测错下一个指令而导致的问题；还有我们需要避免跳转，凡是出现跳转指令都会让编译器去猜测下一个地址，总会猜错，所以流水线友好的代码是要求尽可能地避免跳转，循环展开就是这样的一个例子。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 另外就是要注意流水线的阶段数并不是我这里举的简单的6段，不同硬件划分不同，流水越深预取失败的代价就越大，流水越深可以提高主频。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; 综上，在编码过程中，一方面，可以通过特别优化帮助编译器猜测下一条指令的位置；另一方面，可以通过在算法上选择跳转少的算法来获得流水线友好的算法，比如倒排表压缩PforDelta算法，几乎无跳转，还可以通过循环展开显示地减少跳转。</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp; 当然这里所提到的都是理想的情况下，但事实上流水线是会停滞的，包括（1）总线争用（2）数据相关（3）猜测错下一条指令，其中第3个已经讨论过，下一次会讨论（1）和（2）这两种情况，以及乱序执行方面的一些想法。</P>
<P>&nbsp;</P>]]></description>
</item><item>
<title><![CDATA[大规模数据处理漫谈【3】]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=45945</link>
<author>liangbin</author>
<pubDate>2009/6/11 10:01:15</pubDate>
<description><![CDATA[<P>最后讲解一个优化话题，结束磁盘部分的内容。<BR>&nbsp;&nbsp; 我们知道无论如何磁盘是一个慢速设备，在大规模数据处理时，例如归并排序。总会有类似这样的情况：<BR>&nbsp;&nbsp; for all block-i of the file<BR>&nbsp;&nbsp; {<BR>&nbsp;&nbsp; &nbsp;(1) Read block-i to buffer<BR>&nbsp;&nbsp; &nbsp;(2) Process Data in buffer<BR>&nbsp;&nbsp; }<BR>&nbsp;&nbsp; 这样在任意一个时刻，要么CPU闲了，要么磁盘闲了，造成这个局面的原因是我们只有一个buffer，注意即便多线程，只要是一个buffer也不可避免会等待。<BR>&nbsp;&nbsp; 粗略算一下处理时间：<BR>&nbsp;&nbsp; 令：第（1）个语句需时间为R；第（2）个语句需要时间为P；总块数为n。<BR>&nbsp;&nbsp; 则总耗时为:n(P+R)<BR><BR>&nbsp;&nbsp; 如果这样处理<BR>&nbsp;&nbsp; <BR>&nbsp;&nbsp; 时间流向<BR>&nbsp;&nbsp; ---------------------------------------------------------&gt;<BR>&nbsp;&nbsp; Read block-1 to buffer1 &nbsp;Read block-2 to buffer2 ...<BR>&nbsp;&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;Process Data in buffer1 Process Data in Buffer2 ...<BR><BR>&nbsp;&nbsp; 可以看出block-2的读取（IO密集），process buffer1(CPU密集）重叠起来。<BR>&nbsp;&nbsp; 假定R的时间是其主导地位的。<BR>&nbsp;&nbsp; 则最后的总时长为nR+P,显然已经比n(R+P)要小得多，但问题是是否还可以再省呢？答案是不可以，因为nR的开销是不可避免的，而总有最后一次在读取完(R)后需要进行一次处理（P）,否则R就是废IO。因此至少有一个P是不可以被“隐藏”起来的。<BR>&nbsp;&nbsp; <BR>&nbsp;&nbsp; 实现的时候只需要双缓存，双线程即可，一个线程用来读取数据，一个线程用来处理数据。<BR>&nbsp;&nbsp; 但问题是真得不能再快了吗？nR能否在压缩呢？我们想到了用阵列的方法，在资源允许的情况下，如果我们有2块盘，这样一半的数据在盘A上读取，一半的数据在盘B上读取<BR>&nbsp;&nbsp; &nbsp;Read block-1 from disk1&amp;2 to buffer1 &nbsp;Read block-2 from disk1&amp;2 to buffer2<BR>&nbsp;&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;Process Data in buffer1<BR>&nbsp;&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;<BR><BR>&nbsp;&nbsp; &nbsp;显然最后的总时长约为(nR/2+P),处理器2个buffer的时间可以隐藏在2次磁盘并发读取中。这就是RAID 0，特别是硬件RAID 0几乎不需CPU的参与。<BR><BR>&nbsp;&nbsp; &nbsp;最后就需要讨论一下多大的block size为宜，可能直觉的认为block size越小越好，因为最后一次P不可免，block size越小，最后一次P的代价就越小，但这里有一个误解，nR并不是一个常数，block size越小 n越大，读取的次数越多，其结果时间反而长。因此确定一次读取的内容是需要在实践中调节的一个重要参数。<BR></P>
<P>讨论参考：<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=14865">http://www.newsmth.net/bbscon.php?bid=715&amp;id=14865</A></P>]]></description>
</item><item>
<title><![CDATA[大规模数据处理漫谈【2】]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=45944</link>
<author>liangbin</author>
<pubDate>2009/6/11 9:59:56</pubDate>
<description><![CDATA[<P>上回说到了磁盘的一些特性，感觉不说说文件不太妥。以及对比文件系统和raw device的优劣。<BR><BR>&nbsp;&nbsp; 在目前的各种文件系统中，JFS是一种比较适合大规模数据处理的文件系统，但常用的依然是ext2,ext3. 不同的文件系统受到特定业务的影响在保持通用的前提下，各有侧重，下面谈谈主要优化需要考虑的问题：<BR><BR>&nbsp;&nbsp; 文件系统都要求整块读写磁盘的，按照block size = 4K为例，如果需要在一个块上写1K数据，则首先需要从磁盘将这个块读入内存，在内存中写入1K数据（看做是合并块中其他数据），再回写磁盘。显然如果写的是4K数据，且恰好是写在一个块上的，则系统就免去读入内存和合并的开销，因此我们一般一次写入尽可能多，例如写入10K，则有可能是前两个是整块写，而后一个是半块写，半块写的额外代价摊下来就不显的很多。<BR>&nbsp;&nbsp;<BR>&nbsp;&nbsp; 由于寻道时间是磁盘访问代价中最大的一块，而且道次跳得越大代价越高，因此我们希望文件所包含的块（fileplace命令查看）尽可能连续，而文件系统也是这么做得，但遗憾的是无论怎样，文件也会向不连续的方向发展，特别是系统中各种文件大量创建，追加，删除后。因此在磁盘长期使用后，明明文件是顺序读写，但实际上已经是随机读写。这叫做文件碎片。<BR><BR>&nbsp;&nbsp; 如果事先知道结果文件的大小预分配是很好的选择，怎样快速创建一个大文件呢？<BR>&nbsp;&nbsp; 这里有个快速的方法：<BR>&nbsp;&nbsp; int fd = open("./file", O_RDWR|O_CREAT|O_TRUNC,00777);<BR>&nbsp;&nbsp; off64_t set = 5*G;<BR>&nbsp;&nbsp; lseek64(fd,set,SEEK_SET);<BR>&nbsp;&nbsp; write(fd,"\0",1);<BR>&nbsp;&nbsp; 然而遗憾的是，这样的做法分配的是一个空洞文件（稀疏文件），这个貌似5G的文件大小其实并没有申请到真正的磁盘块，只有在实际写入的时候才会分配，BDB的临时文件db00x就是这么创建出来的，这也是BDB慢的一个重要原因。<BR>&nbsp;&nbsp; 怎么快速创建一个真正的大文件呢？我留一个问题，请大家回答。<BR>&nbsp;&nbsp; 另外附带的一个问题是，为什么写磁盘比读磁盘要慢，慢在哪里，如果去掉这一部分是否可以加快写的速度？<BR>&nbsp;&nbsp; <BR>&nbsp;&nbsp; 文件系统无论如何也很难满足业务上的需要，大部分情况下需要直接处理raw device。或者说自己按照业务需要对裸设备进行格式化，创建自己的特定读写系统。<BR>&nbsp;&nbsp; 比如这样一个场景，需要对每一天的数据(key,value pair)写入raw device, key都是定长而value大小各异。如果把key，data 看做二维，看成如下矩形:<BR>&nbsp;&nbsp; <BR>&nbsp;&nbsp; date(近 ----------------------------&gt;远)<BR>&nbsp;&nbsp; -------------------------------------------<BR>key| &nbsp;A | &nbsp;B<BR>&nbsp;&nbsp; |----|---------------------------------C<BR>&nbsp;&nbsp; | &nbsp; &nbsp;|<BR>&nbsp;&nbsp; | &nbsp; &nbsp;|<BR>&nbsp;&nbsp; -------------------------------------------<BR>&nbsp;&nbsp; 不难理解越近的日期访问频率越高(A区访问的概率远大约B区，A区为热区），而某些key会在一个长的日期范围内长期使用(线C是访问热点，叫做热线吧）。<BR><BR>&nbsp;&nbsp; 首先我们系统数据按照日期的顺序进行存放，条件允许的话，越近日期的数据放在距离raw device 零位置越近的区域，数据在顺序读写时均不会出现跃2个磁道以上的情况。在业务上这种顺序读写是显然的，大量的，数据按天生产，按天处理写入，使用（读）也多为按天处理。随机读写也多发生于A区，A区所占的道次比较有限，因此跳跃的道次也一般较少。不跳的概率较高。C线也很有趣，比如顺序读取某个key，全部天数的数据，则无论由近读到远或者由远读到近，道次都好像电梯一样升降，不会来回跑，因此开销也是很小的，当然与A区相比，想尽可能不跳只转是不可能的了。<BR><BR>&nbsp;&nbsp; 但如何解决value大小各异的问题呢？外部需要哪些索引呢？raw device怎么copy呢，怎么备份呢？在容量不够时如何扩展呢？在享受了raw device的好处后，还需要解决很多这些细节的问题，需要在实际的环境中更多实践。</P>
<P>&nbsp;&nbsp; 转自<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=14744">http://www.newsmth.net/bbscon.php?bid=715&amp;id=14744</A></P>
<P>&nbsp;&nbsp; <BR></P>]]></description>
</item><item>
<title><![CDATA[大规模数据处理漫谈【1】]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=45834</link>
<author>liangbin</author>
<pubDate>2009/6/6 7:38:43</pubDate>
<description><![CDATA[
<P>&nbsp;&nbsp; 大规模数据处理是什么？<BR>&nbsp;&nbsp; 大规模数据处理我认为就是在有限的机器资源的情况下，通过软件和硬件共同完成的G以上级别的数据计算和存储。<BR>&nbsp;&nbsp; 北大已经开了这么课程，可见重要性。<BR>&nbsp;&nbsp; <A href="http://net.pku.edu.cn/~course/cs402/CC_Syllabus-0.3.pdf">http://net.pku.edu.cn/~course/cs402/CC_Syllabus-0.3.pdf</A></P>
<P>&nbsp;&nbsp; 大规模数据处理有哪些应用场合？<BR>&nbsp;&nbsp; （1）搜索引擎，搜索引擎需要存储数10亿的有效网页，并进行快速的全文检索，这是最主要的战场。<BR>&nbsp;&nbsp; （2）数据挖掘，日志分析，商业智能等，业务上产生的大规模日志需要进行有效地加工和分析，使用传统的通用结构化查询数据库已经很难满足特定的业务需要。<BR>&nbsp;&nbsp; （3）科学计算，一般是那些复杂的大数据量的并行计算场合。<BR>&nbsp;&nbsp; <BR>&nbsp;&nbsp; 如何掌握大规模数据处理的各种技术？<BR>&nbsp;&nbsp; （1）理解使用的机器和操作系统。<BR>&nbsp;&nbsp; （2）理解业务的特性。<BR>&nbsp;&nbsp; （3）将特定机器和特定业务发挥到极致的计算程序。</P>
<P>&nbsp; 首先我们看一下我们平常使用的机器（下面进入细节）<BR>&nbsp; <BR>&nbsp;&nbsp; 磁盘和文件系统<BR>&nbsp;&nbsp; 现代磁盘一般被抽象为一个线性的块数据组，在顺序访问块的情况下，可以认为寻道时间是某个固定值（大约10ms左右），传输时间大约是10-100ms/MB,磁盘的外延到内延的访问速度线性递减，外延部分是读写最高效的部分。<BR>&nbsp;&nbsp; 多个盘块可以通过RAID 0的方式组在一起，在寻道时间不变的情况下，大大提高了传输数据量（可以看做是并发的磁盘访问），但是RAID 0没有冗余，数据不安全，中间计算过程使用比较适宜。RAID 0可以有硬件和软件的方法，使用硬件的方法在使用时节省更多的ＣＰＵ时间。<BR>　大规模数据处理的场合，以处理日志为例，一般均为顺序处理，通常采用异步，直接ＩＯ的方法进行处理，异步的磁盘访问在内核２.?<BR>&nbsp;&nbsp; 一些其他的技巧，在大规模数据处理的过程中，基本的模型是read process write。整个过程中总是有读有写的，因此读写分离很重要，读盘和写盘不要是同一个盘，可以用iostat命令实时查询当前磁盘使用状况。<BR>&nbsp; <BR>&nbsp; 磁盘和文件系统，不同机器参数都不同，可以采用hdparam等方法进行检测和优化。必须充分了解所使用机器的特性，能够估计出执行程序大致的耗时，才可能优化到得极限。</P>
<P>&nbsp;&nbsp; 今天就写到这里，下一次写内存。</P>
<P>转自水木<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=14649&amp;start=14649&amp;pno=1">http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=14649&amp;start=14649&amp;pno=1</A></P>
<P>我自写自转<BR>&nbsp;</P>]]></description>
</item><item>
<title><![CDATA[搜索引擎的一些方向]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=42648</link>
<author>liangbin</author>
<pubDate>2009/1/28 19:53:12</pubDate>
<description><![CDATA[
<P>search agent（搜索代理）<BR>掌握搜索技能的，能够接触互联网的，有充分时间学习的人永远只是少数。更多的是需要整理后的高价值的知识和信息，搜索代理就是这样一个把需求提交出去，通过代理，获得高质量搜索结果的基本想法，代理在这个过程中好像编辑一样，创造了增值的服务，我们可以把百度知道看做是一种搜索代理的形式。搜索代理还不仅仅局限于这样的形式，还可以做得更多。<BR><BR>internet archive（互联网存档）<BR>今天我们能通过上万年前的古老甲骨文来追溯远古的历史，而由于越来越多的信息存储在电子设备上，从而使得这种文化的传承延续变得更加复杂，每天都有无数的网页消失在我们的视野里，因此internet archive就肩负起记录历史的重任。<BR><A href="http://www.archive.org/details/arsdigita" target=_blank>http://www.archive.org/details/arsdigita</A><BR><BR>visual search(可视化搜索)<BR>可视化搜索使得搜索过程进行了很大的改造，搜索过程的变得更加简单，找到答案的途径更加直接。<BR><A href="http://www.searchme.com/" target=_blank>http://www.searchme.com/</A><BR><BR>collection search(特定领域的搜索）<BR>这和垂直搜索不同，这个collection可能是菜谱，琴谱，水浒传，圣经等这样的集合。如果把搜索引擎看做一个平台和渠道，那么原始数据完全是可以有个人和团体来组织和维护的。只要这个collection是有价值的，有专门受众的，就应该可以通过高质量的服务创造实际的价值。<BR>（注：collection search这个提法是我翻译完Managing gigabyes以后受启发创造的）<BR><BR>mobile search(移动搜索）<BR>手机普及度如此之大，和人同在的时间如此之长，这个领域太大了，但是成熟的应用太少了。<BR><BR>security search（安全的搜索）<BR>网络病毒，木马使得互联网并不安全，搜索引擎应该担负起创造安全搜索的重任。考虑到搜索引擎已经涉足到了浏览器领域，这个需求可以整合在浏览器中，或者使用某种其他形式来创建一个安全的浏览互联网和搜索互联网的工具。<BR></P>
<P></P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;梁斌</P>
<P>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;2009年南京家中</P>
<P>&nbsp;</P>
<P>&nbsp;</P>]]></description>
</item><item>
<title><![CDATA[麦凯恩的败选演讲failure is mine not yours]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41869</link>
<author>liangbin</author>
<pubDate>2008/12/20 21:46:51</pubDate>
<description><![CDATA[<P>&nbsp; 并不是失败者的话语更能打动人,而是我们能从麦凯恩的演讲中体会到美国的伟大.国家利益总是高于一切的,特别是听到下面的几段</P>
<P>&nbsp;I urge all Americans who supported me to join me in not just congratulating him, but offering our next president our good will and earnest effort to find ways to come together to find the necessary compromises to bridge our differences and help restore our prosperity, defend our security in a dangerous world, and leave our children and grandchildren a stronger, better country than we inherited.</P>
<P>&nbsp; 和</P>
<P>I wish Godspeed to the man who was my former opponent and will be my president. And I call on all Americans, as I have often in this campaign, to not despair of our present difficulties, but to believe, always, in the promise and greatness of America, because nothing is inevitable here.<BR></P>
<P>Americans never quit. We never surrender.<BR></P>
<P>&nbsp; 美国太强大了.</P>]]></description>
</item><item>
<title><![CDATA[2008年在裁员风中摇摆的跨国公司(Z)]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41868</link>
<author>liangbin</author>
<pubDate>2008/12/20 20:52:45</pubDate>
<description><![CDATA[今年以来华尔街爆发的金融海啸已经在美国IT巨头的三季报得到体现。美国时间10月21日，雅虎公司呈出一份相当惨淡的第三财季报告，净利润骤降64%，只有5430万美元，合每股收益4美分，而上年同期净利润为1.513亿美元，合每股收益11美分。
<P>　　雅虎同时下调了当前财政年度的收入预期，收入预期区间从之前的73.5亿至78.5亿美元下调至71.8亿至73.8亿美元，并将在全球范围内至少裁员10%，约1500人。</P>
<P>　　10月23日微软也公布了截至9月30日第一财季报告，实现净利润43.7亿美元，每股收益48美分，净利润同比仅增长2%，微软解释为因经济环境欠佳导致销售额增速放缓。微软同样将当前财年每股收益预期从7月份作出的2.12-2.18美元下调至2-2.10美元，并将收入预期从之前的673亿-681亿美元下调至649亿-664亿美元。</P>
<P>　　应对销售疲软和业绩下滑压力，众多科技公司选择裁员来削减开支。9月份惠普公司就宣布，由于在努力整合收购的技术咨询公司电子资讯系统的业务，计划将裁减24600名员工，即员工总数的7.5%。戴尔公司首席执行长迈克尔·戴尔也表示，去年以来已在全球范围裁减了约8900名员工，即员工总数的10%。</P>
<P>　　10月6日上午，eBay正式宣布裁员10%，即1500名员工。被解雇的员工中，既包括1100名来自eBay拍卖部门的员工，也包括400名来自eBay支付子公司(PayPal)的员工。分析人士表示，eBay对年增长非常缓慢的拍卖部门进行大裁员，尚在情理之中，可是对年增长率将近50%、市场占有率远远高于第二名Google Checkout的PayPal业务部门也毫不留情确实出人意料。</P>
<P>　　从国内来看，裁员风波中在华的外资公司首当其冲，近日有传言AMD全球裁员500人，波及中国公司多个部门；摩托罗拉全球裁3500人，中国公司裁员数未确定。另外近日在沪白领之间流传着一份178家企业裁员名单，其中涉及22家跨国企业、40家国内大中型企业和116家国内中小型企业，使白领阶层出现一片恐慌。</P>
<P>　　近日，一份列举了22家跨国企业、40家国内大中型企业、116家国内中小型企业的“大裁员第一波”企业名单，正通过各大公司的企业邮箱在上海、北京、深圳等地的白领中传播。</P>
<P>　　邮件详细列举了22家近期将要或已裁员的跨国企业名单。其中特别指明，今年9月，一家从事抗肿瘤药品制售的生物制药公司，对位于上海浦西的公司运营部门进行了全员裁减。而据邮件撰写者推断，该公司位于浦东的制药工厂也即将关门。此外，一家冠以某北欧国家名的外资银行，也被邮件叙述为员工“都跳了”，公司状况“已经一塌糊涂”。</P>
<P>　　邮件中，还有近期将要或已经裁员的国内大中型企业名单，被点名的企业有40家。其中有3家航空公司、多家钢铁企业以及包括一家中国台湾公司在内的3家半导体企业。另外，合俊玩具厂、百灵达电子公司这些已正式宣布破产清盘的企业，则出现在116家近期将要或已经裁员的国内中小型企业名单中。</P>
<P>&nbsp;</P>
<P><A href="http://tech.cn.aol.com/defaultdetail.jsp?keyid=4868734489046360633">http://tech.cn.aol.com/defaultdetail.jsp?keyid=4868734489046360633</A></P>
<SCRIPT language=JavaScript>
function submitComments(queryString)
{
   var p = document.addComment.addCommentHere.value;
   if (p == null || p.length == 0)
      return;
   var author = document.addComment.commentAuthor.value;
   if (author==null)
      author ="";
   queryString = queryString + '&author='+ author + '&text=' + p;
   
   //alert("queryString got is:");
   //alert(queryString);
   
   //alert("Start submit review");
   new Ajax.Updater('trricomment', 'addComment.jsp', { method: 'post', parameters: queryString});
   //alert("Finsih submit review");
   
}

function displayComments(queryString)
{
   queryString = queryString+ "&t=" + (new Date()).getTime();
   new Ajax.Updater('trricomment', 'trricmt.jsp?'+ queryString, {method:'get'});
   
}
function incCount(){
new Ajax.Request('trricount.jsp?'+'appId=cnaolcom&type=article&objectURI=CN:4868734489046360633&category=tech');
}

function successAlert(){
alert("成功发表评论！");
}

function senceWordAlert(){
alert("由于含有敏感文字，评论发表不成功。");    
}

function changefocus(elementId){
  var ele=document.getElementById(elementId);
  ele.focus();
}
</SCRIPT>]]></description>
</item><item>
<title><![CDATA[google的product search]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41762</link>
<author>liangbin</author>
<pubDate>2008/12/15 23:02:16</pubDate>
<description><![CDATA[<P>google.com的首页顺序依次是</P>
<DIV id=gbar><NOBR>&nbsp;&nbsp;<A class=gb1 onclick=gbar.qs(this) href="http://www.google.com/search?hl=en&amp;sa=N&amp;tab=fw"><FONT color=#0000cc>Web</FONT></A> <A class=gb1 onclick=gbar.qs(this) href="http://images.google.com/images?hl=en&amp;sa=N&amp;tab=fi"><FONT color=#0000cc>Images</FONT></A> <A class=gb1 onclick=gbar.qs(this) href="http://maps.google.com/maps?hl=en&amp;sa=N&amp;tab=fl"><FONT color=#0000cc>Maps</FONT></A> <A class=gb1 onclick=gbar.qs(this) href="http://news.google.com/news?hl=en&amp;sa=N&amp;tab=fn"><FONT color=#0000cc>News</FONT></A> <B class=gb1>Shopping</B> <A class=gb1 href="http://mail.google.com/mail/?sa=N&amp;tab=fm"><FONT color=#0000cc>Gmail</FONT></A> <A class=gb3 onclick="this.blur();gbar.tg(event);return !1" href="http://www.google.com/intl/en/options/"><FONT color=#0000cc>more</FONT></A></NOBR></DIV>
<DIV><NOBR></NOBR>&nbsp;</DIV>
<DIV><NOBR>&nbsp; 购物搜索已经排到第五名了，可见流量之大，国内搜索貌似这方面还没有跟进啊。</NOBR></DIV>]]></description>
</item><item>
<title><![CDATA[谷歌医药门]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41693</link>
<author>liangbin</author>
<pubDate>2008/12/12 9:04:41</pubDate>
<description><![CDATA[<P><A href="http://video.sina.com.cn/tech/i/v/2008-12-11/17325443.shtml">http://video.sina.com.cn/tech/i/v/2008-12-11/17325443.shtml</A></P>
<P>&nbsp; 和奶粉门没有本质区别，虚假医药广告开始很少，后来利益驱动，放多了，产生质变了，就成了某某门。</P>
<P>&nbsp; 企业的社会责任永远依赖于舆论的监督来保证，google也不例外。</P>]]></description>
</item><item>
<title><![CDATA[珍爱网摘取2008年中国互联网最具价值项目奖(ZZ sina)]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41692</link>
<author>liangbin</author>
<pubDate>2008/12/12 8:59:03</pubDate>
<description><![CDATA[<A>　在互联网产业面临“寒冬”之际，主题为“信念与坚守”的2008中国互联网年会日前在京拉开序幕。年会上隆重推出了“2008年中国互联网最具价值项目奖”，表彰3个自上届中国互联网年会以来在中国互联网领域成功实施、创新突出、效果显著的优秀项目——珍爱网“网络征选+电话红娘人工服务”的模式获此殊荣，同时，凭借着对企业的出色领导，珍爱网董事长李松博士也摘取了“中国互联网创新人物奖”。
<P>　　面对互联网的“冬天”，李松踌躇满志，信心十足：2000年，他第一次创业时，美国NASDAQ突然崩盘，冬天一夕之间降临，凭借着与几位创业伙伴的努力打拼，他不仅幸运的过了冬，还积累下了宝贵的“御寒经验”。这一次，李松笑言：“我早已穿足‘衣服’。” </P>
<P>　　珍爱网是李松在第一次创业之后，经过审慎思考后开始的第二次创业。2005年，李松将珍爱网的前身“中国交友中心”收购，并立即着手全面改造，开创了中国第一家红娘网站，改名为“珍爱网”，并推出了全球独有的服务模式——网络征选+电话红娘人工服务。模式推出后，迅速得到用户好评，注册用户量从3年前的100万，迅速增长至1000余万，2008年始，更是以每天新增3万用户的流量在增长。月收入已超过其主要3家竞争对手的月收入总和。</P>
<P>　　金融危机发生之后，珍爱网的业务不减反增，呈现持续增长的良性态势，李松对此解释道：“‘网络征选+电话红娘人工服务’是我们结合了国际先进经验，并融合了中国国情，针对繁忙的都市白领创新的模式，网络征选让会员可以在我们庞大的数据库中选择自己中意的结婚对象，电话红娘人工服务旨在帮助双方解决恋爱过程中遭遇到的瓶颈问题，这种模式能够省时高效地为繁忙的单身男女解决婚姻难题。”</P>
<P>　　第一次寒冬过后，人们看到了门户网站的迅速崛起，那这一次寒冬过后，互联网产业又将迎来怎样的变化呢？李松博士凭借自己多年投行的经历以及互联网行业两次创业的经验断言：只要有好的模式，冬天的来临就意味着春天不再遥远。李松告诉记者：在12月2日刚刚公布的由美国著名科技企业杂志《Red Herring》的评选中，珍爱网获得了“Red Herring亚洲100强”创新科技企业的荣誉，时隔一周，再次拿到2008互联网年会两项大奖，让他对珍爱网的模式更具信心，“一种模式成功与否要看它是否经得住用户的检验，珍爱网的模式的确能够有效的解决婚恋难题，未来一个阶段，我们会更大力度的优化服务细节，为更多有需求的人提供服务，真正做到成就天下姻缘”。</P></A>]]></description>
</item><item>
<title><![CDATA[从产品经理到副总裁]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41670</link>
<author>liangbin</author>
<pubDate>2008/12/10 22:35:31</pubDate>
<description><![CDATA[<P>李治国曾经是阿里巴巴的产品经理，后创办口碑网，回归阿里巴巴后就是副总裁了。</P>
<P>如果继续在阿里巴巴做，能做到副总裁嘛？人的价值的提升有时候真得很不好说啊。</P>
<P>&nbsp;</P>
<P>相关链接</P>
<P><A href="http://it.sohu.com/20070803/n251410803.shtml">http://it.sohu.com/20070803/n251410803.shtml</A></P>]]></description>
</item><item>
<title><![CDATA[电子图片钥匙链(Electronics photo key chain )]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41594</link>
<author>liangbin</author>
<pubDate>2008/12/7 19:17:40</pubDate>
<description><![CDATA[
<P>Tao Electronics photo <SPAN class=yshortcuts id=lw_1228486122_13>key chain</SPAN> 是一种很有趣的产品，连接PC就可以下载各种图片，放在钥匙扣上在你需要的时候就可以滚动播放。</P>
<P>&nbsp; 这是一种很容易传播的产品，我相信有一天这类产品在我们身边也能随处看到。</P>
<P>&nbsp;</P>
<P><IMG src="http://i7.ebayimg.com/05/i/001/1a/24/4e4f_1_bl.JPG" border=0 name=eBayBig></P>]]></description>
</item><item>
<title><![CDATA[(Music video games ,吉他英雄)]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41593</link>
<author>liangbin</author>
<pubDate>2008/12/7 19:15:41</pubDate>
<description><![CDATA[
<P>Guitar Hero III</P>
<P>《吉他英雄》系列是一款为吉他爱好者专门设计的音乐游戏，通过模拟的音乐演奏让玩家亲身体验成为摇滚吉他明星的快感和喜悦。<BR>　</P>
<P>&nbsp; 这类游戏总能获得年轻人的喜爱</P>]]></description>
</item><item>
<title><![CDATA[Roku Netflix Player]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41592</link>
<author>liangbin</author>
<pubDate>2008/12/7 19:11:12</pubDate>
<description><![CDATA[
<P><A>　<SPAN class=yshortcuts id=lw_1228486122_0>Roku Netflix Player</SPAN> </A>（售价100美元左右）</P>
<P><IMG title="" height=282 alt="Roku Netflix Player set-top box" src="http://www.dabbledoo.com/ee/images/uploads/gadgetell/netflix_roku_425.jpg" width=425></P>
<P><A href="http://www.gadgetell.com/tech/tag/set-top/">http://www.gadgetell.com/tech/tag/set-top/</A></P>
<P>&nbsp; 据说电视台做过调研，每过一年，电视的用户就在老龄化一年，年轻人更多的去PC上看电视和游戏了。<BR>&nbsp; 此前电视游戏，任天堂，索尼等成功的把游戏连接到了电视，成就了一段传奇的过去。<BR>&nbsp; 今天Roku和Netflix又试图把点播节目直接（绕开PC）连接到电视。<BR>&nbsp; 这个服务在美国包月费是9美元。<BR>&nbsp; 播放器售价不过100美元。<BR>&nbsp; 国内不知道能不能把这个做起来。<BR></P>]]></description>
</item><item>
<title><![CDATA[Microsoft Appoints Dr. Qi Lu to Run Online Services Group]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41590</link>
<author>liangbin</author>
<pubDate>2008/12/7 12:16:07</pubDate>
<description><![CDATA[<H1>Microsoft Appoints Dr. Qi Lu to Run Online Services Group</H1>
<H2 class=subtitle>Yahoo! veteran to oversee Internet offerings for consumers, advertisers and publishers.</H2>
<DIV style="HEIGHT: 18px"></DIV>
<P><B>REDMOND, Wash. — Dec. 4, 2008 —</B> Microsoft Corp. today announced that Dr. Qi Lu will join the company as president of the Online Services Group. Dr. Lu will lead Microsoft’s efforts in search and online advertising and all the company’s online information and communications services. Dr. Lu will report to Microsoft Chief Executive Officer Steve Ballmer.</P>
<P>Lu, 47, most recently served as executive vice president of Engineering for the Search and Advertising Technology Group at Yahoo!, where he was responsible for development efforts around Yahoo!’s Web search and monetization platforms. Dr. Lu left Yahoo! in August 2008 after 10 years of service.</P>
<TABLE id=ctl08_tblControl style="FLOAT: left; BORDER-COLLAPSE: collapse" cellSpacing=0 cellPadding=0 border=0>
<TBODY>
<TR id=ctl08_trcontrol>
<TD id=ctl08_tdcontrol align=middle>
<TABLE id=ctl08_tblImage style="WIDTH: 147px; BORDER-COLLAPSE: collapse" cellSpacing=0 cellPadding=0 border=0>
<TBODY>
<TR id=ctl08_trImage>
<TD id=ctl08_tdImage style="PADDING-RIGHT: 10px; PADDING-LEFT: 0px; PADDING-BOTTOM: 0px; PADDING-TOP: 10px" align=middle><A title="Dr. Qi Lu will join Microsoft as president of the Online Services Group effective Jan. 5, 2009." href="http://www.microsoft.com/presspass/images/exec/print/QiLu_print.jpg"><IMG title="Dr. Qi Lu will join Microsoft as president of the Online Services Group effective Jan. 5, 2009." style="BORDER-TOP-WIDTH: 0px; BORDER-LEFT-WIDTH: 0px; BORDER-BOTTOM-WIDTH: 0px; BORDER-RIGHT-WIDTH: 0px" alt="Dr. Qi Lu will join Microsoft as president of the Online Services Group effective Jan. 5, 2009." src="http://www.microsoft.com/presspass/images/exec/page/QiLu_page.jpg"></A></TD></TR>
<TR>
<TD class=figureCaption id=ctl08_tdCaption style="PADDING-RIGHT: 10px; PADDING-LEFT: 0px; PADDING-BOTTOM: 0px; PADDING-TOP: 0px" align=middle><B>Dr. Qi Lu will join Microsoft as president of the Online Services Group effective Jan. 5, 2009.</B></TD></TR>
<TR>
<TD class=downloadCaption id=ctl08_tdSubCaptions style="PADDING-RIGHT: 10px; PADDING-LEFT: 0px; PADDING-BOTTOM: 10px; PADDING-TOP: 0px" align=middle><A href="http://www.microsoft.com/presspass/images/exec/print/QiLu_print.jpg">High-res image.</A> <BR></TD></TR></TBODY></TABLE></TD></TR></TBODY></TABLE>
<P>“I am tremendously excited to welcome Qi to Microsoft,” Ballmer said. “Dr. Lu’s deep technical expertise, leadership capabilities and hard-working mentality are well-known in the technology industry, and Microsoft will benefit from his addition to our executive management team.”</P>
<P>“I am genuinely excited about the opportunities ahead for Microsoft to make an enormous impact on the online industry,” Dr. Lu said. “Microsoft has built a great foundation for its search and advertising technologies and put an amazing team of researchers and engineers in place to drive the next wave of innovation in online services. I’m looking forward to working with them to help transform the way people and businesses use the Internet to find and share information.”</P>
<P>Before his most recent role at Yahoo!, Lu was vice president of engineering responsible for the technology development of Yahoo!’s Search and Marketplace business unit, which includes the company’s search, e-commerce, and local listings of businesses and products. </P>
<P>Before joining Yahoo! in 1998, Dr. Lu was a Research Staff Member at IBM Almaden Research Center. Before IBM, Dr. Lu worked at Carnegie Mellon University as a Research Associate, and at Fudan University in China as a faculty member. Dr. Lu holds 20 U.S. patents, and received his bachelor of science and master of science in computer science from Fudan University and his Ph.D. in computer science from Carnegie Mellon University.</P>
<P>Lu’s first day at Microsoft will be Jan. 5, 2009. In his role running the Online Services Group, he will oversee several groups including the Advertiser &amp; Publisher Solutions business, managed by Scott Howe who was promoted to corporate vice president; the Online Audience business, managed by Senior Vice President Yusuf Mehdi; OSG Research &amp; Development, managed by Senior Vice President Satya Nadella; and OSG Finance, managed by Rik van der Kooi who was promoted to corporate vice president.</P>
<P>With the successful integration of aQuantive now complete, Brian McAndrews, former CEO of aQuantive and senior vice president of Microsoft’s Advertiser &amp; Publisher Solutions Group, has decided to transition out of Microsoft, and will do so over the next several months, serving in a consultative capacity to Steve Ballmer and Qi Lu during that time.</P>
<P>“Brian McAndrews built a world-class business for advertisers and publishers and led the successful integration of aQuantive into Microsoft, setting the foundation for our next phase of growth,” Ballmer said. “While I am sorry to see Brian leave the company, I respect and understand his decision and wish him nothing but the best in the future.”</P>
<P>“I also want to congratulate Scott and Rik on their well-deserved promotions and look forward to their leadership in the Online Services Group alongside Qi, Yusuf and Satya,” Ballmer said.</P>
<P>As part of today’s announcement, several teams will move to further align resources. The field sales organizations in the Online Services Group will move to Microsoft’s centralized Sales, Marketing and Services Group led by chief operating officer Kevin Turner. This group, called Consumer &amp; Online, will be led by Corporate Vice President Darren Huston and will include the Global Advertising Sales and Services organization, led by vice president Bill Shaughnessy.</P>
<P>Founded in 1975, Microsoft (Nasdaq “MSFT”) is the worldwide leader in software, services and solutions that help people and businesses realize their full potential.</P>
<P><I>Note to editors:</I> If you are interested in viewing additional information on Microsoft, please visit the Microsoft Web page at <A href="http://www.microsoft.com/presspass">http://www.microsoft.com/presspass</A> on Microsoft’s corporate information pages. Web links, telephone numbers and titles were correct at time of publication, but may since have changed. For additional assistance, journalists and analysts may contact Microsoft’s Rapid Response Team or other appropriate contacts listed at <A href="http://www.microsoft.com/presspass/contactpr.mspx">http://www.microsoft.com/presspass/contactpr.mspx</A>.</P>
<P>&nbsp;</P>]]></description>
</item><item>
<title><![CDATA[记得看百度某人博客，弱问一题]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41510</link>
<author>liangbin</author>
<pubDate>2008/12/3 23:52:44</pubDate>
<description><![CDATA[
<DIV class=article id=art3026>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Nov 27 05:34:21 2007), 站内<BR><BR>&nbsp;&nbsp; &nbsp;此博客好像是周利民同学的，说百度入职工程师都要做一个扫描千万量级的文件，要求在10分钟内完成。<BR>&nbsp;&nbsp; &nbsp;我想了解一下实现细节，除了用多线程把CPU和I/O重叠起来的技术外，还用了那些special的技术呢？<BR>&nbsp;&nbsp; &nbsp;另外这个千万量级的文件是文本行呢？还是一个个序列化后的数据对象啊？哪位达人介绍一下啊。<BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3028">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3028">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3028">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>2</DIV></DIV>
<DIV class=article id=art3028>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Nov 27 06:17:41 2007), 站内<BR><BR>我说的数据有误，原文如下：<BR><BR>百度招聘的工程师在加入公司后，有一道入门练习题，就是编写一个数据扫描分析程序，要求写出的程序能在1分钟之内扫描分析完千万量级的数据，才算及格。高水平的程序员可以利用高效的算法在10秒以内解决问题，甚至只要六七秒。但如果没用对算法，花一星期的时间，也做不到1分钟之内。<BR>大家可以设想一下，百度有十亿以上的网页，如果要在一周甚至三天内处理一遍，平均每秒处理要多少个？每天1亿次的检索又意味着峰值时每秒要处理多少次检索？事实上，针对一个问题，我们可以想出很多的算法，但如果效率不高，是无法真正投入使用的。 <BR><BR>link:<A href="http://hi.baidu.com/wujixiaofeng/blog/item/f2e7dbf24e0f2212b07ec5a1.html" target=_blank>http://hi.baidu.com/wujixiaofeng/blog/item/f2e7dbf24e0f2212b07ec5a1.html</A><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: &nbsp; &nbsp; 此博客好像是周利民同学的，说百度入职工程师都要做一个扫描千万量级的文件，要求在10分钟内完成。</SPAN><BR><SPAN class=f006>: &nbsp; &nbsp; 我想了解一下实现细节，除了用多线程把CPU和I/O重叠起来的技术外，还用了那些special的技术呢？</SPAN><BR><SPAN class=f006>: &nbsp; &nbsp; 另外这个千万量级的文件是文本行呢？还是一个个序列化后的数据对象啊？哪位达人介绍一下啊。</SPAN><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3056">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3056">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3056">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>3</DIV></DIV>
<DIV class=article id=art3056>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Nov 27 19:39:39 2007), 站内<BR><BR>我来猜想一下啊。可能百度搞一个千万行的一个文件，然后10秒内在控制台输出某一行的某一个数，算作扫描一遍，不知道版上有没有人说说怎么搞。<BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 我说的数据有误，原文如下：</SPAN><BR><SPAN class=f006>: 百度招聘的工程师在加入公司后，有一道入门练习题，就是编写一个数据扫描分析程序，要求写出的程序能在1分钟之内扫描分析完千万量级的数据，才算及格。高水平的程序员可以利用高效的算法在10秒以内解决问题，甚至只要六七秒。但如果没用对算法，花一星期的时间，也做不到1分钟之内。</SPAN><BR><SPAN class=f006>: 大家可以设想一下，百度有十亿以上的网页，如果要在一周甚至三天内处理一遍，平均每秒处理要多少个？每天1亿次的检索又意味着峰值时每秒要处理多少次检索？事实上，针对一个问题，我们可以想出很多的算法，但如果效率不高，是无法真正投入使用的。 </SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3234">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3234">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=youngvonlee">youngvonlee</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3234">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>4</DIV></DIV>
<DIV class=article id=art3234>发信人: youngvonlee (cls), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Dec &nbsp;4 10:01:39 2007), 站内<BR><BR>同问，另外，周利民同学的百度空间地址是？<BR>--<BR>自然语言处理，算法，嵌入式开发。<BR>python.<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 211.144.112.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3257">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3257">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3257">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>5</DIV></DIV>
<DIV class=article id=art3257>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Dec &nbsp;4 20:57:16 2007), 站内<BR><BR>问了个百度朋友，据说是有<BR>10分钟内排序千万量级的数据，采用naive的多路归并排序就可以了，而且还不用本地（空间复杂度O(1)）的归并排序。。。<BR>古老搜索引擎入门书（MG）中提到过一种归并方法，称作R路归并（R远小于临时归并段数）。<BR>不知道搜索引擎怎么做这种归并的，那位达人出来介绍一下。。。<BR><BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 我说的数据有误，原文如下：</SPAN><BR><SPAN class=f006>: 百度招聘的工程师在加入公司后，有一道入门练习题，就是编写一个数据扫描分析程序，要求写出的程序能在1分钟之内扫描分析完千万量级的数据，才算及格。高水平的程序员可以利用高效的算法在10秒以内解决问题，甚至只要六七秒。但如果没用对算法，花一星期的时间，也做不到1分钟之内。</SPAN><BR><SPAN class=f006>: 大家可以设想一下，百度有十亿以上的网页，如果要在一周甚至三天内处理一遍，平均每秒处理要多少个？每天1亿次的检索又意味着峰值时每秒要处理多少次检索？事实上，针对一个问题，我们可以想出很多的算法，但如果效率不高，是无法真正投入使用的。 </SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR><BR><BR>--<BR><BR>※ 修改:·pennyliang 于 Dec &nbsp;4 20:57:50 修改本文·[FROM: 58.30.83.*]<BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3258">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3258">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3258">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>6</DIV></DIV>
<DIV class=article id=art3258>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Dec &nbsp;4 21:35:37 2007), 站内<BR><BR>去算法版问，会有一堆人跳出来。。<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 问了个百度朋友，据说是有</SPAN><BR><SPAN class=f006>: 10分钟内排序千万量级的数据，采用naive的多路归并排序就可以了，而且还不用本地（空间复杂度O(1)）的归并排序。。。</SPAN><BR><SPAN class=f006>: 古老搜索引擎入门书（MG）中提到过一种归并方法，称作R路归并（R远小于临时归并段数）。</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.28.238.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3259">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3259">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3259">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>7</DIV></DIV>
<DIV class=article id=art3259>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Tue Dec &nbsp;4 21:58:28 2007), 站内<BR><BR>不混算法版很多年。。。<BR>这种问题主要是工程经验，算法版能给出的解答想都想的出来，就那么些。。。<BR>【 在 godking (oh my godking) 的大作中提到: 】<BR><SPAN class=f006>: 去算法版问，会有一堆人跳出来。。</SPAN><BR><BR><BR><BR>--<BR><BR>※ 修改:·pennyliang 于 Dec &nbsp;4 22:00:39 修改本文·[FROM: 58.30.83.*]<BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3260">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3260">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3260">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>8</DIV></DIV>
<DIV class=article id=art3260>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Wed Dec &nbsp;5 09:42:29 2007), 站内<BR><BR>好吧，呵呵<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 不混算法版很多年。。。</SPAN><BR><SPAN class=f006>: 这种问题主要是工程经验，算法版能给出的解答想都想的出来，就那么些。。。</SPAN><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.30.134.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3263">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3263">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3263">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>9</DIV></DIV>
<DIV class=article id=art3263>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Wed Dec &nbsp;5 17:29:45 2007), 站内<BR><BR>其实我发文的目的是勾引大牛入坑，答案对我来说不重要了，哈哈。。。<BR><BR>【 在 godking (oh my godking) 的大作中提到: 】<BR>好吧，呵呵<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 不混算法版很多年。。。</SPAN><BR><SPAN class=f006>: 这种问题主要是工程经验，算法版能给出的解答想都想的出来，就那么些。。。</SPAN><BR><BR><BR>--<BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 211.99.222.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3264">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3264">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=kabbesy">kabbesy</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3264">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>10</DIV></DIV>
<DIV class=article id=art3264>发信人: kabbesy (Arthas), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Wed Dec &nbsp;5 17:30:17 2007), 站内<BR><BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 其实我发文的目的是勾引大牛入坑，答案对我来说不重要了，哈哈。。。</SPAN><BR>...................<BR><SPAN class=f006>: 好吧，呵呵</SPAN><BR><BR><BR>--<BR>There can be miracles When you believe !<BR><BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 61.49.185.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3328">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3328">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3328">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>11</DIV></DIV>
<DIV class=article id=art3328>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:01:29 2007), 站内<BR><BR>我来抛个方案，进行归并排序，大家拍<BR><BR>首先，给出一个common sense的东西，便于下面讨论。<BR>如果两个有序段（L1，L2），其中L1的最小元素小于L2的最小元素（L1[0]&lt;L2[0]）进行归并，则实际上需要的辅助空间大小不是Len（L1）+Len（L2），而是min(Len(L1),Len(L2)).归并的方法如下：这里假定Len(L1)=Len(L2)=k<BR>&nbsp;(1)申请一个段长为K的大小作为辅助数组为E。<BR>（2）E不空时，将L1，L2当前最大的数与E中的数swap（后面有例子说明）<BR>（3）最后的排序结果为L1,E<BR>例子<BR>L1: &nbsp;1 3 5 8<BR>L2: &nbsp;4 6 7 9<BR>E: &nbsp; 10 20 30 40<BR><BR>(1)9&gt;8,则有<BR><BR>L1: &nbsp;1 3 5 8<BR>L2: &nbsp;4 6 7 40<BR>E: &nbsp; 10 20 30 9<BR>(2)8&gt;7,则有<BR><BR>L1: &nbsp;1 3 5 30<BR>L2: &nbsp;4 6 7 40<BR>E: &nbsp; 10 20 8 9<BR><BR>(3)7&gt;5,则有<BR>L1: &nbsp;1 3 5 30<BR>L2: &nbsp;4 6 20 40<BR>E: &nbsp; 10 7 8 9<BR><BR>(3)6&gt;5,则有<BR>L1: &nbsp;1 3 5 30<BR>L2: &nbsp;4 10 20 40<BR>E: &nbsp; 6 7 8 9<BR><BR>(3)5&gt;4,（此时E已经Full，交换5，30）<BR>L1: &nbsp;1 3 30 5<BR>L2: &nbsp;4 10 20 40<BR>E: &nbsp; 6 7 8 9<BR><BR>(3)4&gt;3,（交换4，30）<BR>L1: &nbsp;1 3 30 5<BR>L2: &nbsp;4 10 20 40<BR>E: &nbsp; 6 7 8 9<BR><BR>(3)4&gt;3,（交换4，30）<BR>L1: &nbsp;1 3 4 5<BR>L2: &nbsp;30 10 20 40<BR>E: &nbsp; 6 7 8 9<BR><BR>此时 归并的结果为L1+E,为1,3,4,5,6,7,8,9 而原来有序的10,20,30,40这个段作为辅组数组，自身的顺序在排序后被破坏了（这个性质很重要）<BR><BR><BR><BR><BR><BR><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3329">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3329">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3329">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>12</DIV></DIV>
<DIV class=article id=art3329>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:13:54 2007), 站内<BR><BR>其次，多路合并<BR>众所周知，这种归并在搜索引擎中将多个临时到排文件归并成一个时大量应用，这里我们只是一般性的讨论。<BR><BR>假定有16个归并段（这是有可能的），进行归并排序<BR>L1<BR>L2<BR>L3<BR>...<BR>L16<BR><BR>(1)对L1,L2,L3,L4进行归并，假定段长均为K,则申请3K的辅助空间可以进行归并<BR>(2)归并后，L1,和这个3K的辅助空间构成了有序段，而L2,L3,L4,作为辅助空间为后来的归并充当辅助数组（这里解释一下用最小段，是为了节约最后的几次拷贝，从上面的例子可以看出，L1的最小几个元素是不需要move的）<BR>(3)L1,..L4归并为M1，L5,...,L8归并为M2,..这样归并变为对M1,M2,M3,M4进行归并。<BR>。。。<BR>(4)最后必须对两个有序段进行归并，这样辅助空间还是需要相当与问题规模的一半大小。<BR><BR>当然也可以采用辅组空间为O(1)的归并方法，大家先拍，稍后再发出这种归并方法。。。<BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 我来抛个方案，进行归并排序，大家拍</SPAN><BR><SPAN class=f006>: 首先，给出一个common sense的东西，便于下面讨论。</SPAN><BR><SPAN class=f006>: 如果两个有序段（L1，L2），其中L1的最小元素小于L2的最小元素（L1[0]&lt;L2[0]）进行归并，则实际上需要的辅助空间大小不是Len（L1）+Len（L2），而是min(Len(L1),Len(L2)).归并的方法如下：这里假定Len(L1)=Len(L2)=k</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3330">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3330">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3330">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>13</DIV></DIV>
<DIV class=article id=art3330>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:21:17 2007), 站内<BR><BR>参考此贴，获得空间复杂度O(1)的归并排序，我就不写了，呵呵。。。<BR><A href="http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A" target=_blank>http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A</A><BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 其次，多路合并</SPAN><BR><SPAN class=f006>: 众所周知，这种归并在搜索引擎中将多个临时到排文件归并成一个时大量应用，这里我们只是一般性的讨论。</SPAN><BR><SPAN class=f006>: 假定有16个归并段（这是有可能的），进行归并排序</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3331">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3331">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3331">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>14</DIV></DIV>
<DIV class=article id=art3331>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:28:10 2007), 站内<BR><BR>简单的说就是把l1和l2多路归并到E，然后把l2中剩下的插入到l1<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 我来抛个方案，进行归并排序，大家拍</SPAN><BR><SPAN class=f006>: 首先，给出一个common sense的东西，便于下面讨论。</SPAN><BR><SPAN class=f006>: 如果两个有序段（L1，L2），其中L1的最小元素小于L2的最小元素（L1[0]&lt;L2[0]）进行归并，则实际上需要的辅助空间大小不是Len（L1）+Len（L2），而是min(Len(L1),Len(L2)).归并的方法如下：这里假定Len(L1)=Len(L2)=k</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.28.238.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3332">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3332">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3332">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>15</DIV></DIV>
<DIV class=article id=art3332>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:30:19 2007), 站内<BR><BR>搜原地归并有一些paper，有个基于块交换的原地归并算法还不错，呵呵<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 参考此贴，获得空间复杂度O(1)的归并排序，我就不写了，呵呵。。。</SPAN><BR><SPAN class=f006>: <A href="http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A" target=_blank>http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A</A></SPAN><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.28.238.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3333">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3333">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3333">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>16</DIV></DIV>
<DIV class=article id=art3333>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:32:59 2007), 站内<BR><BR>L2中的还需要和L1余部进行比较，确定那个插，那个不插在L1的尾部。<BR>比较形象的一个说法，可以参见Sara Basse的哪本算法书。。。<BR><BR>【 在 godking (oh my godking) 的大作中提到: 】<BR><SPAN class=f006>: 简单的说就是把l1和l2多路归并到E，然后把l2中剩下的插入到l1</SPAN><BR><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3334">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3334">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3334">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>17</DIV></DIV>
<DIV class=article id=art3334>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:35:19 2007), 站内<BR><BR>简单说来就是拿自己的一个最大块（或最小块）做辅助空间，最后再排序这个辅助空间<BR>剩下的块，按最小元素排序，然后顺序归并。<BR>细节就看这个链接：<A href="http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A" target=_blank>http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A</A>。<BR><BR>【 在 godking (oh my godking) 的大作中提到: 】<BR><SPAN class=f006>: 搜原地归并有一些paper，有个基于块交换的原地归并算法还不错，呵呵</SPAN><BR><BR><BR><BR>--<BR><BR>※ 修改:·pennyliang 于 Dec &nbsp;9 09:35:54 修改本文·[FROM: 58.30.83.*]<BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3335">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3335">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3335">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>18</DIV></DIV>
<DIV class=article id=art3335>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:37:06 2007), 站内<BR><BR>但不知道人家搜索引擎采用了什么special的排序方法，大牛给大家介绍介绍吧。<BR>最关键的是，搜索引擎doclist是压缩的，在这种压缩的情况下，如何进行归并，这个我始终没想明白，我猜测大概有这几种可能<BR>（1）例如n个临时到排文件，都有termx的doclist,且是压缩的，那么归并n个压缩的doclist,就必须使得压缩的doclist采用同步点，或者自同步编码的方式，可以便将长的doclist cut掉<BR>（2），每个临时到排文件对term的doclist的长度进行限制，当达到某个长度后，写在其他的临时到排文件中。<BR><BR><BR>【 在 godking (oh my godking) 的大作中提到: 】<BR><SPAN class=f006>: 搜原地归并有一些paper，有个基于块交换的原地归并算法还不错，呵呵</SPAN><BR><BR><BR><BR>--<BR><BR>※ 修改:·pennyliang 于 Dec &nbsp;9 09:41:23 修改本文·[FROM: 58.30.83.*]<BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3336">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3336">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3336">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>19</DIV></DIV>
<DIV class=article id=art3336>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:39:14 2007), 站内<BR><BR>可能说的不是一种,<BR>那种是l1和l2等大小的块交换的,<BR>能抓到耗子就行，呵呵，不说了<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 简单说来就是拿自己的一个最大块（或最小块）做辅助空间，最后再排序这个辅助空间</SPAN><BR><SPAN class=f006>: 剩下的块，按最小元素排序，然后顺序归并。</SPAN><BR><SPAN class=f006>: 细节就看这个链接：<A href="http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A" target=_blank>http://bbs.nju.edu.cn/vd89098/bbsanc?path=/groups/GROUP_3/Algorithm/D82FEB0BE/D89D07C10/M.1072426129.A</A>。</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.28.238.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=3337">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=3337">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=godking">godking</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=3337">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026#top">返回顶部</A>] 
<DIV class=tnum>20</DIV></DIV>
<DIV class=article id=art3337>发信人: godking (oh my godking), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 记得看百度某人博客，弱问一题<BR>发信站: 水木社区 (Sun Dec &nbsp;9 09:40:33 2007), 站内<BR><BR>大侠你把baidu贴出来，找xuchuan把google的贴出来，找glass把sogou的贴出来。。。<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 但不知道人家搜索引擎采用了什么special的排序方法，大牛给大家介绍介绍吧。</SPAN><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 60.28.238.*]<BR><A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026">http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=3026</A></DIV>]]></description>
</item><item>
<title><![CDATA[搜索引擎中的压缩技术]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41509</link>
<author>liangbin</author>
<pubDate>2008/12/3 23:43:24</pubDate>
<description><![CDATA[
<DIV class=article id=art6480>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: 搜索引擎中的压缩技术<BR>发信站: 水木社区 (Sat May 10 09:40:33 2008), 站内<BR><BR>&nbsp;<BR>&nbsp;&nbsp;压缩的本质是识别重复，如果每个东西都是Unique的，哪根本没法压缩。因此重复的部分可以采用同一的编码。<BR>&nbsp;&nbsp;压缩的技巧还需要考虑概率，概率高的编码码长短。<BR>&nbsp;&nbsp;数值范围，数值范围越小，编码码长越短。例如一个1-10之间变化的变量，那么编码的长度之需要[log2(10)]即可.<BR><BR>&nbsp;&nbsp;以英文字典为例。说明识别重复的方法<BR>&nbsp;&nbsp;由于英语的构词法，重复是很多的，前缀，后缀，词根等。如果按照单词的字符串排序，可以发现很多前缀重复。例如：<BR>&nbsp;&nbsp;labber<BR>&nbsp;&nbsp;labor<BR>&nbsp;&nbsp;laborator<BR>&nbsp;&nbsp;....<BR>&nbsp;&nbsp;如果这样编码将能够获得空间上的节省<BR>&nbsp;&nbsp;labber &nbsp; &nbsp; &nbsp; 0,6,labber<BR>&nbsp;&nbsp;labor &nbsp; &nbsp; &nbsp; &nbsp;4,2,or<BR>&nbsp;&nbsp;laborator &nbsp; &nbsp;6,4,ator<BR>&nbsp;<BR>&nbsp;&nbsp;start,len,str,start表示起始位置,len表示长度，str表示实际字符。<BR>&nbsp;&nbsp;例如,4,2,or表示该字符和上一个相比，从第4位开始变化，长度为2，这样之需要取出前 labber的前3个字母lab和or合并就可以找到这个单词。<BR>&nbsp;&nbsp;<BR>&nbsp;&nbsp;当然还可以进一步识别出大量出现的后缀例如tion，在结构上进一步优化。<BR>&nbsp;&nbsp;<BR>&nbsp;&nbsp;概率分析的方法不再举例，对数值范围搜索引擎也有特别有趣的技巧，可参见《走进搜索引擎》游程编码一节。<BR>&nbsp;&nbsp;一个杂乱无章的数列，可以通过排序，得到一个差序列，使得每个值变小，能够以更短的码长编码，例如<BR>&nbsp;&nbsp;4，10，6，9，24，46<BR>&nbsp;&nbsp;排序后<BR>&nbsp;&nbsp;4,6,9,10,24,46<BR>&nbsp;&nbsp;两两求差，得到<BR>&nbsp;&nbsp;4,2,3,1,14,22<BR>&nbsp;&nbsp;这样数值区间就被理想的压缩了。<BR><BR>&nbsp;&nbsp;<BR>&nbsp;&nbsp;<BR>--<BR>硕士要啥自行车啊 &nbsp;<BR><BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=6481">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=6481">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=nkwht">nkwht</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=6481">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6480#top">返回顶部</A>] 
<DIV class=tnum>2</DIV></DIV>
<DIV class=article id=art6481>发信人: nkwht (低调做人, 踏实做事), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 搜索引擎中的压缩技术<BR>发信站: 水木社区 (Sat May 10 10:30:21 2008), 站内<BR><BR>有记得以前看过专门讲 压缩技术的 书籍<BR>里面大段篇章讲解文本压缩的一些经典算法<BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: &nbsp; 压缩的本质是识别重复，如果每个东西都是Unique的，哪根本没法压缩。因此重复的部分可以采用同一的编码。</SPAN><BR><SPAN class=f006>: &nbsp; 压缩的技巧还需要考虑概率，概率高的编码码长短。</SPAN><BR><SPAN class=f006>: &nbsp; 数值范围，数值范围越小，编码码长越短。例如一个1-10之间变化的变量，那么编码的长度之需要[log2(10)]即可.</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 123.118.66.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=6484">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=6484">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=pennyliang">pennyliang</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=6484">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6480#top">返回顶部</A>] 
<DIV class=tnum>3</DIV></DIV>
<DIV class=article id=art6484>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 搜索引擎中的压缩技术<BR>发信站: 水木社区 (Sat May 10 18:32:20 2008), 站内<BR><BR>对压缩有兴趣吗？来参加MG一书的翻译吧。<BR>【 在 nkwht (低调做人, 踏实做事) 的大作中提到: 】<BR><SPAN class=f006>: 有记得以前看过专门讲 压缩技术的 书籍</SPAN><BR><SPAN class=f006>: 里面大段篇章讲解文本压缩的一些经典算法</SPAN><BR><BR><BR>--<BR>硕士要啥自行车啊 &nbsp;<BR><BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=6493">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=6493">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=kuangtu">kuangtu</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=6493">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6480#top">返回顶部</A>] 
<DIV class=tnum>4</DIV></DIV>
<DIV class=article id=art6493>发信人: kuangtu ((狂徒，Web逛BBS男）), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 搜索引擎中的压缩技术<BR>发信站: 水木社区 (Sun May 11 00:48:55 2008), 站内<BR><BR>前段时间看lucene的源码，碰巧阅读的就是posting排序以后，压缩的过程。哈哈<BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: 对压缩有兴趣吗？来参加MG一书的翻译吧。</SPAN><BR><BR>--<BR>房子居然变成了合法抢劫的工具！<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 221.219.1.*]<BR><A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6480">http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6480</A></DIV>]]></description>
</item><item>
<title><![CDATA[有个想法大家一起来拍（关于collection的概念）]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41508</link>
<author>liangbin</author>
<pubDate>2008/12/3 23:42:38</pubDate>
<description><![CDATA[
<DIV class=article id=art7278>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: 有个想法大家一起来拍<BR>发信站: 水木社区 (Sun Jun &nbsp;8 19:01:09 2008), 站内<BR><BR>&nbsp;&nbsp;海量数据用不同视角可以切割成不同的collection。<BR>&nbsp;&nbsp;websearch 切出了网页，可能还能进一步的切出娱乐的collection和体育的collection。<BR>&nbsp;&nbsp;newssearch 切出了新闻。<BR>&nbsp;&nbsp;...<BR>&nbsp;&nbsp;面向不同的对象还可以切出，例如儿童collection,妇女collection。<BR>&nbsp;&nbsp;各种各样的切法，甚至可以把自己电脑上的桌面搜索，切成不同的collection。<BR>&nbsp;&nbsp;于是每次选择可以选择在指定的一个或者若干个collection中进行检索，这将多么有趣，好像餐馆的资助餐一样。多了一些互动，增加了一些乐趣。<BR>&nbsp;&nbsp;当然这并不是或不全是垂直搜索，比如可以有这样的用例<BR>&nbsp;&nbsp;在用户输入一个关键词后，立即给出，不同collection下的结果数,引导用户到更加精准的collection中，最后每个collection甚至可以由某个第三方公司制作，开发，提供给开放搜索引擎使用，收取看该collection的用户的产生的广告费。后发的搜索引擎应该更加开放，联合一切可以联合的力量，统战一切可以战斗的力量，在战场上取得一些独自战斗难以得到的战果。<BR>&nbsp;&nbsp;<BR>&nbsp;&nbsp;<BR>--<BR>硕士要啥自行车啊 &nbsp;<BR><BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=7289">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=7289">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=areqi">areqi</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=7289">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=7278#top">返回顶部</A>] 
<DIV class=tnum>2</DIV></DIV>
<DIV class=article id=art7289>发信人: areqi (阿琦), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 有个想法大家一起来拍<BR>发信站: 水木社区 (Sun Jun &nbsp;8 21:24:35 2008), 站内<BR><BR>前端时间我也发过这样的想法。见我的5354文。这个东西其实对Google也是有力的，"google是地主，我们是长工.."忘记谁这么说的了..<BR>我本来想等几年，自己赚够一票以后，找更多的资源来做这件事情...我觉得Google App Engine也许真能走到这一天....<BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: &nbsp; &nbsp;是啊，也就只有google有这个能力开放他的计算资源，数据资源，和技术资源了。如果google这样搞好了，我相信再也没有共军战胜国军的神话了。</SPAN><BR><BR><BR>--<BR><BR>※ 修改:·areqi 于 Jun &nbsp;8 21:34:43 2008 修改本文·[FROM: 125.34.2.*]<BR>※ 来源:·水木社区 newsmth.net·[FROM: 125.34.2.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=7304">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=7304">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=xuchuan">xuchuan</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=7304">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=7278#top">返回顶部</A>] 
<DIV class=tnum>3</DIV></DIV>
<DIV class=article id=art7304>发信人: xuchuan (xuchuan), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 有个想法大家一起来拍<BR>发信站: 水木社区 (Sun Jun &nbsp;8 22:12:53 2008), 站内<BR><BR>如果每个用户可以任意使用10M的网页，那么光1k用户就有10个billion的网页。google至少需要为这10个billion的网页提供额外的标记吧。并且这些标记肯定不能做在现有的index里边，需要额外的存储空间来保存url-&gt;tag这样的数据。另外再考虑这些网页的ranking问题，如果光是google来做，那基本没啥意义。如果是交给用户来做，那是不是应该允许用户提交一些binary到google的机器上运行呢？这样又会有安全性问题、效率问题等等，google又不可能把自己ranking的内部数据开放，于是用户得自己做ranking算法，这样就对存储提出了进一步的要求，总要存一些相关的signal吧。再说用户自己的ranking算法的quality又没法得到足够保证。<BR>像这样往深处考虑一下，就会发现大规模数据量的自定义搜索引擎是不切实际的，真要干这事情的公司还不如自己做。<BR><BR>【 在 areqi (阿琦) 的大作中提到: 】<BR><SPAN class=f006>: 10M~100M..</SPAN><BR><SPAN class=f006>: 或者几千个网站..</SPAN><BR><BR><BR>--<BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 123.118.13.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=7308">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=7308">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=areqi">areqi</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=7308">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=7278#top">返回顶部</A>] 
<DIV class=tnum>4</DIV></DIV>
<DIV class=article id=art7308>发信人: areqi (阿琦), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 有个想法大家一起来拍<BR>发信站: 水木社区 (Sun Jun &nbsp;8 22:55:53 2008), 站内<BR><BR>Good，终于进入一些细节的讨论了，说一下我的看法，只是一个思路.需要大家共同讨论..同时对所有的通用搜索都有用，不一定是针对Google..<BR>1.Google不需要针对用户的网页做标记。<BR>Google提供的是一个网页库，然后提供访问这个库的接口。这个库的访问方式可以是某个网站所有的网页，或者是用户比如检索"汽车”拿到的网页。所以这个库的接口Google内部系统应该是已经有了。Google也根本没有必要针对用户的使用做标记，用户需要什么通过提供的接口告诉Google好了，用户用了那些网页由用户自己决定。如果说考虑计费，完全可以基于流量或者请求总数来，就像App Engine这么做的。<BR><BR>2.用户需要做什么<BR>a.知道自己需要哪些网页，并且维护自己需要的网页。<BR>b.需要针对抓取的网页采用与Google完全不同的处理方式，包括索引，信息抽取当然也必须包括Ranking..所以会自己产生大量数据。除了网页一样以外，别的和Google没有任何区别？<BR>c.1000万个网页，由用户维护的数据包括索引，程序等等每个用户100G够了吧? 100G不算多啊，Amazon EC2一个最初级的配置就有200G硬盘了,Google APP Engine也可以为用户提供远超100G的空间。<BR><BR>3.有价值吗？<BR>1.对Google或者其他通用搜索，或者Amazon这样的云计算提供商。这是云计算在搜索引擎的一种典型应用。可以按照使用的CPU时间，硬盘空间，请求数目等等收钱。<BR>2.对网站开发公司或者个人，自己去抓取并且维护自己的网页库是需要成本的，如果说Google的费用，比自己维护一套抓取，网页系统成本低，那就可以接受。而且很多网站都对不知名的爬虫做限制的.<BR>3.现在的爬虫太多了......只要一家或者几家爬下来就好了....能大大减小网站负担..<BR><BR><BR>【 在 xuchuan (xuchuan) 的大作中提到: 】<BR><SPAN class=f006>: 如果每个用户可以任意使用10M的网页，那么光1k用户就有10个billion的网页。google至少需要为这10个billion的网页提供额外的标记吧。并且这些标记肯定不能做在现有的index里边，需要额外的存储空间来保存url-&gt;tag这样的数据。另外再考虑这些网页的ranking问题，如果光是g</SPAN><BR><SPAN class=f006>: 像这样往深处考虑一下，就会发现大规模数据量的自定义搜索引擎是不切实际的，真要干这事情的公司还不如自己做。</SPAN><BR><BR><BR>--<BR><BR>※ 修改:·areqi 于 Jun &nbsp;8 22:57:54 2008 修改本文·[FROM: 125.34.2.*]<BR>※ 来源:·水木社区 newsmth.net·[FROM: 125.34.2.*]<BR><A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=7278">http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=7278</A></DIV>]]></description>
</item><item>
<title><![CDATA[昨晚互联网协会的论坛启发颇深]]></title>
<link>http://blogger.org.cn/blog/more.asp?name=liangbin&amp;id=41507</link>
<author>liangbin</author>
<pubDate>2008/12/3 23:41:17</pubDate>
<description><![CDATA[
<DIV class=article id=art6928>发信人: pennyliang (pennyliang), 信区: SearchEngineTech<BR>标 &nbsp;题: 昨晚互联网协会的论坛启发颇深<BR>发信站: 水木社区 (Sun May 25 07:30:56 2008), 站内<BR><BR>&nbsp;&nbsp; &nbsp;首先互联网协会的朝气很赞，很强大。<BR>&nbsp;&nbsp; &nbsp;不知道这里还有没有人用过网际精灵社区，2000年以前这是一个很火热的社区，尚属于跑马圈地的年代，当时我就在这样一家公司，北极星软件公司。嘉宾谈到的很多问题，那时我们就总结和分析过，当然是比较初级和幼稚的，这里我大致把社区总结一下。<BR>&nbsp;&nbsp; &nbsp;首先看社区满足的是怎样的需求，争夺的是用户那一部分的时间。占领的是哪一座山头。网民上网的时间总是有限的，在有限的时间里要从事很多活动，不同的人有多有少，社区满足的需求大概是这样几点：<BR>&nbsp;&nbsp; &nbsp;（1）了解信息，这可能出乎很多人意料，现在的人们不再满足于XXTV，不在满足于官方的阉割后的信息，需要新奇，甚至不上大雅之堂的，娱乐性的信息，社区是一个很好的传播平台，很多朋友说不看新闻，因为可以在社区里面看到各种重要的新闻。可见社区具有媒体的一面。纸媒，电媒，互联网媒体可以采用的方式，社区也同样能采用。<BR>&nbsp;&nbsp; &nbsp;（2）沟通，第一个需求可能满足的是潜水这的猎奇，新鲜等单向的需求。而沟通是网民作为主体参与到社区的互动中，这可能会涌现出一些社区红人，输出的更多，大部分是一般的网民，进行一些对称的沟通。沟通就是江湖，沟通就是人聚集的地方，人多的地方就是江湖，可见社区具有很强的交互性，这也是社区的一大特点，和粘性之强的奥秘。当你在一个江湖的时候，你想退出都必须考虑其他人的感受时，江湖的魅力就显现了。<BR>&nbsp;&nbsp; &nbsp;（3）文化，社区的文化总是有群众决定的，因此天然就具备了与时俱进的特点，也就特别能符合网民的或者说一部分网民的需要，每个人都需要有文化认同感，水木有水木的文化，如果不融入某种文化，就会感到很孤立，很孤独，校内实名制形成了真实感强的文化，myspace.cn形成了知产阶层的文化，强大的文化感召力，吸引了大量的用户。<BR>&nbsp;&nbsp; &nbsp; <BR>&nbsp;&nbsp; &nbsp; 活动中两个热点话题，开放平台和反围剿，很值得思考。<BR>&nbsp;<BR>&nbsp;&nbsp; &nbsp; 开放平台，随着facebook的推广，已经成为本年度最热点的话题之一，一个企业要想成功必须率众起义，结合更多的资源作战，共军也是统战做的好，才有了最后解放全中国。保守，孤立，最终只能陷于孤芳自赏之中。<BR>&nbsp;&nbsp; &nbsp; <BR>&nbsp;&nbsp; &nbsp; 今天来的嘉宾都是把自己推到了风口浪尖上的英雄，它们必然会遭到传统势力的围剿，活下去，占领一个山头，在扩大根据地。每个人都仅仅抓住自己的用户，满足他们的需要，让自己活下去，只打有把握的仗，看不清楚的暂时不碰，我想若干年后这些人中必然有一些人走得更高更远，祝福他们能做得更好，但不是每个人都能解放全中国。<BR><BR><BR>--<BR>硕士要啥自行车啊 &nbsp;<BR><BR><BR>※ 来源:·水木社区 newsmth.net·[FROM: 58.30.83.*]<BR></DIV><BR>
<DIV class="tconPager smaller left">[<A href="http://www.newsmth.net/bbscon.php?bid=715&amp;id=6935">本篇全文</A>] [<A href="http://www.newsmth.net/bbspst.php?board=SearchEngineTech&amp;reid=6935">回复文章</A>] [本篇作者：<A href="http://www.newsmth.net/bbsqry.php?userid=SandBeach">SandBeach</A>] [<A href="http://www.newsmth.net/bbspstmail.php?board=SearchEngineTech&amp;id=6935">回信给作者</A>] [<A href="http://www.newsmth.net/bbsdoc.php?board=SearchEngineTech">进入讨论区</A>] [<A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6928#top">返回顶部</A>] 
<DIV class=tnum>2</DIV></DIV>
<DIV class=article id=art6935>发信人: SandBeach (沙滩), 信区: SearchEngineTech<BR>标 &nbsp;题: Re: 昨晚互联网协会的论坛启发颇深<BR>发信站: 水木社区 (Sun May 25 19:01:05 2008), 站内<BR><BR>我也来贴一点记录的:<BR><BR>论坛主要分两个部分，一个是嘉宾对SNS社团的认识，另外一个部分则是对于SNS的Panel Talk. 首先从SNS的介绍开始:<BR>1. 谭晓生先开始讲了Myspace在中国第一年发展中所做的事: 主要有汉化，移植，改制和数据迁移。其中提到了一个战略的分析方法，就是终态来分析问题，值得借鉴.<BR>2. 接着麦田开始提到SNS中的一个传播模式: a)发起, b)争论, c)媒介介入, d)传媒/互动, e)结束. 和7个特点: 争论性，戏剧性，冲击性，快速（准确复制），聚众发起，道德判断，商业化传播等. 还有两个结论也很精辟：在我国，网络传播还不是分众模式，分众还是高度集中的，网络传播只是一个放大器的作用。 公众主键在改变对待传播的习惯.<BR>3.Zixia谈了smth的历史和习惯，以及一些新的项目，比如叽歪和twitter的关系.<BR>4.许朝军 谈了SNS的形式，地位，和融资后的影响。其中还谈到了98年陈一舟带着4m$来敲大三师弟门的故事，让人听了yy了一把,期待什么时候下一个bill gates能来宿舍敲门~~~<BR>5. 刘兴亮总结了SNS的四个特点.<BR><BR>最后大家做了panel，回答了一些问题. 个人感觉，大家还是有所保留的，在一些战略问题上总是含糊其次，有所回避。不过还是有点收获，虽然目前中国互联网也有了新的格局，没有以前那么多的圈地机会，用户的基数大，形势还是好的，有潜力可挖。<BR><BR>PS: 会场中看到了几个有意思的东西<BR>1. 在嘉宾和观众的互动上，用了叽歪，下面的观众可以发短信，然后短信的信息就会马上在屏幕上作为问题反馈，今天看来效果还是很好的.(我是第一次看到，不知道是不是old了)<BR>2. 许朝军提到了SNS网络的架构，我觉得和Web的Vision非常像, 有可比性. 看来基于实体，基于关系，基于关系上的应用还是有很多可以挖掘.<BR>Level 4: Culture &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;APP<BR>Level 3: 互动 &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; Mapping(OWL/RDFS)<BR>Level 2: 关系 &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; RDF<BR>Level 1: 用户 &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; URI<BR>3. 关于手机的应用:Zixia的一个思维模式比较有意思。他把手机应用类比成15年前的Windows，大家可以一起来预测今后的应用.<BR>4. 主持人就是上周提供会议室的WangYunMin, 说话很风趣。席间还谈到在座有sougou输入法的创始人，引起下面的一阵骚动,哈<BR><BR>【 在 pennyliang (pennyliang) 的大作中提到: 】<BR><SPAN class=f006>: &nbsp; &nbsp; 首先互联网协会的朝气很赞，很强大。</SPAN><BR><SPAN class=f006>: &nbsp; &nbsp; 不知道这里还有没有人用过网际精灵社区，2000年以前这是一个很火热的社区，尚属于跑马圈地的年代，当时我就在这样一家公司，北极星软件公司。嘉宾谈到的很多问题，那时我们就总结和分析过，当然是比较初级和幼稚的，这里我大致把社区总结一下。</SPAN><BR><SPAN class=f006>: &nbsp; &nbsp; 首先看社区满足的是怎样的需求，争夺的是用户那一部分的时间。占领的是哪一座山头。网民上网的时间总是有限的，在有限的时间里要从事很多活动，不同的人有多有少，社区满足的需求大概是这样几点：</SPAN><BR><SPAN class=f006>: ...................</SPAN><BR><BR>--<BR><BR>※ 来源:·水木社区 <A href="http://newsmth.net/" target=_blank>http://newsmth.net</A>·[FROM: 222.131.184.*]<BR><A href="http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6928">http://www.newsmth.net/bbstcon.php?board=SearchEngineTech&amp;gid=6928</A></DIV>]]></description>
</item>
</channel>
</rss>