deeplearningbook_047-2
·
- Mac hine learning usually acts indirectly . In most machine learning scenarios, we care ab out some p erformance measure P , that is defined with resp ect to the test set and ma y also b e in tractable. W e therefore optimize P only indirectly . W e reduce a different cost function J ( θ ) in the hop e that doing so will improv e P . This is in contrast to pure optimization, where minimizing J is a goal in and of itself. Optimization algorithms for training deep mo dels also t ypically include some sp ecialization on the sp ecific structure of mac hine learning ob jectiv e functions. T ypically , the cost function can b e written as an av erage o v er the training set, suc h as J ( ) = θ E ( ) ˆ x , y ∼ p data L f , y , ( ( ; ) x θ ) (8.1) where L is the p er-example loss function, f ( x ; θ ) is the predicted output when the input is x , ˆ p data is the empirical distribution. In the sup ervised learning case, y is the target output. Throughout this chapter, we develop the unregularized sup ervised case, where the argumen ts to L are f ( x ; θ ) and y . How ev er, it is trivial to extend this developmen t, for example, to include θ or x as arguments, or to exclude y as argumen ts, in order to develop v arious forms of regularization or unsup ervised learning. Eq. defines an ob jective function with resp ect to the training set. W e 8.1 w ould usually prefer to minimize the corresp onding ob jectiv e function where the exp ectation is tak en across the data generating distribution p data rather than just ov er the finite training set: J ∗ ( ) = θ E ( ) x , y ∼ p data L f , y . ( ( ; ) x θ ) (8.2) 8.1.1 Emp irica l Risk Mini miza tion The goal of a machine learning algorithm is to reduce the exp ected generalization error given b y Eq. . This quantit y is kno wn as the . W e emphasize here that 8.2 risk the exp ectation is tak en ov er the true underlying distribution p data . If we knew the true distribution p data ( x , y ) , risk minimization would b e an optimization task 275 --- Page Break --- CHAPTER 8. OPTIMIZA TION FOR TRAINING DEEP MODELS solv able by an optimization algorithm. Ho wev er, when w e do not know p data ( x , y ) but only ha v e a training set of samples, we ha ve a machine learning problem. The simplest wa y to conv ert a machine learning problem back in to an op- timization problem is to minimize the exp ected loss on the training set. This means replacing the true distribution p ( x , y ) with the empirical distribution ˆ p ( x , y ) defined by the training set. W e now minimize the empiric al risk E x , y ∼ ˆ p data ( ) x ,y [ ( ( ; ) )] = L f x θ , y 1 m m i =1 L f ( ( x ( ) i ; ) θ , y ( ) i ) (8.3) where is the n umber of training examples. m The training pro cess based on minimizing this av erage training error is known as empiric al risk minimization . In this setting, machine learning is still v ery similar to straightforw ard optimization. Rather than optimizing the risk directly , w e optimize the empirical risk, and hop e that the risk decreases significantly as well. A v ariety of theoretical results establish conditions under whic h the true risk can b e exp ected to decrease b y v arious amoun ts. Ho w ev er, empirical risk minimization is prone to ov erfitting. Models with high capacity can simply memorize the training set. In many cases, empirical risk minimization is not really feasible. The most effective mo dern optimization algorithms are based on gradien t descent, but many useful loss functions, such as 0-1 loss, ha v e no useful deriv ativ es (the deriv ative is either zero or undefined ev erywhere). These tw o problems mean that, in the context of deep learning, we rarely use empirical risk minimization. Instead, w e must use a slightly differen t approac h, in which the quantit y that w e actually optimize is even more differen t from the quan tit y that we truly wan t to optimize. 8.1.2 Surr ogate Loss F unct ions and Early Stop ping Sometimes, the loss function we actually care ab out (say classification error) is not one that can be optimized efficiently . F or example, exactly minimizing exp ected 0-1 loss is typically in tractable (exp onential in the input dimension), ev en for a linear classifier ( Marcotte and Sav ard 1992 , ). In such situations, one t ypically optimizes a surr o gate loss function instead, which acts as a pro xy but has adv antages . F or example, the negative log-likelihoo d of the correct class is t ypically used as a surrogate for the 0-1 loss. The negativ e log-likelihoo d allows the mo del to estimate the conditional probability of the classes, given the input, and if the mo del can do that well, then it can pick the classes that yield the least classification error in exp ectation. 276 --- Page Break --- CHAPTER 8. OPTIMIZA TION FOR TRAINING DEEP MODELS In some cases, a surrogate loss function actually results in b eing able to learn more. F or example, the test set 0-1 loss often contin ues to decrease for a long time after the training set 0-1 loss has reached zero, when training using the log-lik eliho o d surrogate. This is b ecause ev en when the exp ected 0-1 loss is zero, one can improv e the robustness of the classifier by further pushing the classes apart from each other, obtaining a more confiden t and reliable classifier, th us extracting more information from the training data than would ha v e b een p ossible by simply minimizing the a v erage 0-1 loss on the training set. A very imp ortan t difference b etw een optimization in general and optimization as we use it for training algorithms is that training algorithms do not usually halt at a lo cal minim um. Instead, a mac hine learning algorithm usually minimizes a surrogate loss function but halts when a conv ergence criterion based on early stopping (Sec. ) is satisfied.
- Machine learning usually acts indirectly.
- 固定搭配:无
- 句子分析:简单句,主谓结构,描述机器学习通常的作用方式。
- 翻译:机器学习通常以间接方式起作用。
- 单词分析:
- indirectly:副词,词源来自拉丁语 "indirectus",由 "in-"(否定)+ "directus"(直接的)构成,词义:间接地。
- 记忆方法:联想 "direct"(直接的)加上否定前缀 "in-" 再加上副词后缀 "-ly" 表示间接地。
- 形近词:indirect(形容词,间接的)、direct(形容词,直接的)。
- 发音解析:
- 音节分解:in + di + rect + ly /ˌɪndɪˈrektli/,重音在第二音节
- 规则:in → /ɪn/, “in” 发 /ɪn/ 音,其中 “i” 发短元音 /ɪ/,“n” 发鼻音。
- 规则:di → /dɪ/, “di” 发 /dɪ/ 音,其中 “d” 发 /d/ 音,“i” 发短元音 /ɪ/。
- 规则:rect → /rekt/, “rect” 发 /rekt/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɛ/,“c” 发 /k/ 音,“t” 发 /t/ 音。
- 规则:ly → /li/, “ly” 发 /li/ 音,其中 “l” 发 /l/ 音,“y” 发 /i/ 音。
- indirectly:副词,词源来自拉丁语 "indirectus",由 "in-"(否定)+ "directus"(直接的)构成,词义:间接地。
- In most machine learning scenarios, we care about some performance measure P, that is defined with respect to the test set and may also be intractable.
- 固定搭配:"care about"意为 "关心;关注";"with respect to"意为 "关于;至于"。
- 句子分析:主从复合句,“that”引导的定语从句修饰先行词 “performance measure P”。句子表达在多数机器学习场景中,我们关注某种性能指标P,该指标与测试集有关且可能难以处理。
- 翻译:在大多数机器学习场景中,我们关注某种性能指标P,该指标是相对于测试集定义的,而且可能也难以处理。
- 单词分析:
- scenarios:名词复数,词源来自意大利语 "scenario",原指舞台场景,词义:场景;情景。
- 记忆方法:联想舞台上的场景,“scen” 可看作 “scene”(场景),“-ario” 为名词后缀。
- 形近词:scenario(单数形式)、scene(场景)。
- 发音解析:
- 音节分解:sce + nar + ios /sɪˈnɑːriəʊz/,重音在第二音节
- 规则:sce → /sɪ/, “sce” 发 /sɪ/ 音,其中 “s” 发 /s/ 音,“c” 发 /k/ 音,“e” 发短元音 /ɪ/。
- 规则:nar → /nɑːr/, “nar” 发 /nɑːr/ 音,其中 “n” 发 /n/ 音,“a” 发长元音 /ɑː/,“r” 发 /r/ 音。
- 规则:ios → /iəʊz/, “ios” 发 /iəʊz/ 音,其中 “i” 发长元音 /iː/,“o” 发长元音 /əʊ/,“s” 发 /z/ 音。
- scenarios:名词复数,词源来自意大利语 "scenario",原指舞台场景,词义:场景;情景。
- intractable:形容词,词源来自拉丁语 "intractabilis",由 "in-"(否定)+ "tractare"(处理)构成,词义:难处理的;难对付的。
- 记忆方法:联想 “tract”(处理)加上否定前缀 “in-” 表示难以处理。
- 形近词:tractable(形容词,易处理的)、tract(名词,大片土地;传单)。
- 发音解析:
- 音节分解:in + trac + table /ɪnˈtræktəbl/,重音在第二音节
- 规则:in → /ɪn/, “in” 发 /ɪn/ 音,其中 “i” 发短元音 /ɪ/,“n” 发鼻音。
- 规则:trac → /træk/, “trac” 发 /træk/ 音,其中 “t” 发 /t/ 音,“r” 发 /r/ 音,“a” 发短元音 /æ/,“c” 发 /k/ 音。
- 规则:table → /təbl/, “table” 发 /təbl/ 音,其中 “t” 发 /t/ 音,“a” 发短元音 /ə/,“b” 发 /b/ 音,“l” 发 /l/ 音。
- We therefore optimize P only indirectly.
- 固定搭配:无
- 句子分析:简单句,主谓宾结构,说明我们只能间接优化性能指标P。
- 翻译:因此,我们只能间接优化P。
- 单词分析:
- optimize:动词,词源来自拉丁语 "optimus"(最好的),词义:优化;使最优化。
- 记忆方法:联想 “opt”(选择),选择最好的就是优化。
- 形近词:optimistic(形容词,乐观的)、optimum(名词,最佳状态;形容词,最佳的)。
- 发音解析:
- 音节分解:op + ti + mize /ˈɒptɪmaɪz/,重音在第一音节
- 规则:op → /ɒp/, “op” 发 /ɒp/ 音,其中 “o” 发短元音 /ɒ/,“p” 发 /p/ 音。
- 规则:ti → /tɪ/, “ti” 发 /tɪ/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/。
- 规则:mize → /maɪz/, “mize” 发 /maɪz/ 音,其中 “m” 发 /m/ 音,“i” 发长元音 /aɪ/,“z” 发 /z/ 音。
- optimize:动词,词源来自拉丁语 "optimus"(最好的),词义:优化;使最优化。
- We reduce a different cost function J (θ) in the hope that doing so will improve P.
- 固定搭配:"in the hope that"意为 "希望;期望"。
- 句子分析:主从复合句,“that”引导的同位语从句解释说明 “hope” 的内容。句子意思是我们降低另一个成本函数J(θ),希望这样做能提高性能指标P。
- 翻译:我们降低另一个成本函数J(θ),希望这样做能提高P。
- 单词分析:
- reduce:动词,词源来自拉丁语 "reducere",由 "re-"(回)+ "ducere"(引导)构成,词义:减少;降低。
- 记忆方法:联想 “re-”(往回)+ “duce”(引导),往回引导就是减少。
- 形近词:reduction(名词,减少;降低)、introduce(动词,介绍;引进)。
- 发音解析:
- 音节分解:re + duce /rɪˈdjuːs/,重音在第二音节
- 规则:re → /rɪ/, “re” 发 /rɪ/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɪ/。
- 规则:duce → /djuːs/, “duce” 发 /djuːs/ 音,其中 “d” 发 /d/ 音,“u” 发长元音 /juː/,“c” 发 /s/ 音,“e” 不发音。
- reduce:动词,词源来自拉丁语 "reducere",由 "re-"(回)+ "ducere"(引导)构成,词义:减少;降低。
- This is in contrast to pure optimization, where minimizing J is a goal in and of itself.
- 固定搭配:"in contrast to"意为 "与……形成对比";"in and of itself"意为 "本身;本质上"。
- 句子分析:主从复合句,“where”引导的定语从句修饰先行词 “pure optimization”。句子表明这与纯粹的优化形成对比,在纯粹优化中,最小化J本身就是一个目标。
- 翻译:这与纯粹的优化形成对比,在纯粹优化中,最小化J本身就是一个目标。
- 单词分析:
- pure:形容词,词源来自拉丁语 "purus",词义:纯粹的;纯净的。
- 记忆方法:联想 “pure water”(纯净水)来记忆。
- 形近词:purity(名词,纯净;纯度)、impure(形容词,不纯净的)。
- 发音解析:
- 音节分解:pure /pjʊə(r)/,重音在第一音节
- 规则:pu → /pjʊ/, “pu” 发 /pjʊ/ 音,其中 “p” 发 /p/ 音,“u” 发长元音 /juː/。
- 规则:re → /ə(r)/, “re” 发 /ə(r)/ 音,其中 “e” 发短元音 /ə/,“r” 发音。
- pure:形容词,词源来自拉丁语 "purus",词义:纯粹的;纯净的。
- Optimization algorithms for training deep models also typically include some specialization on the specific structure of machine learning objective functions.
- 固定搭配:无
- 句子分析:简单句,主谓宾结构,说明用于训练深度模型的优化算法通常还会针对机器学习目标函数的特定结构进行一些专门处理。
- 翻译:用于训练深度模型的优化算法通常还会针对机器学习目标函数的特定结构进行一些专门处理。
- 单词分析:
- specialization:名词,词源来自 “specialize”(动词,专门从事;使专业化),词义:专门化;专业化。
- 记忆方法:联想 “special”(特殊的)+ “-ization”(名词后缀)表示专门化。
- 形近词:specialize(动词)、special(形容词,特殊的)。
- 发音解析:
- 音节分解:spe + cial + i + za + tion /ˌspeʃəlaɪˈzeɪʃn/,重音在第三音节
- 规则:spe → /spiː/, “spe” 发 /spiː/ 音,其中 “s” 发 /s/ 音,“p” 发 /p/ 音,“e” 发长元音 /iː/。
- 规则:cial → /ʃəl/, “cial” 发 /ʃəl/ 音,其中 “c” 发 /ʃ/ 音,“i” 发短元音 /ə/,“a” 发短元音 /ə/,“l” 发 /l/ 音。
- 规则:i → /aɪ/, “i” 发长元音 /aɪ/。
- 规则:za → /zeɪ/, “za” 发 /zeɪ/ 音,其中 “z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ə/,“o” 不发音,“n” 发鼻音。
- specialization:名词,词源来自 “specialize”(动词,专门从事;使专业化),词义:专门化;专业化。
- objective:形容词,词源来自拉丁语 "objectivus",词义:客观的;目标的;名词,词义:目标;目的。
- 记忆方法:联想 “object”(物体)+ “-ive”(形容词后缀),物体是客观存在的,所以有客观的意思。
- 形近词:subjective(形容词,主观的)、object(名词,物体;目标)。
- 发音解析:
- 音节分解:ob + jec + tive /əbˈdʒektɪv/,重音在第二音节
- 规则:ob → /əb/, “ob” 发 /əb/ 音,其中 “o” 发短元音 /ə/,“b” 发 /b/ 音。
- 规则:jec → /dʒek/, “jec” 发 /dʒek/ 音,其中 “j” 发 /dʒ/ 音,“e” 发短元音 /ɛ/,“c” 发 /k/ 音。
- 规则:tive → /tɪv/, “tive” 发 /tɪv/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/,“v” 发 /v/ 音。
- Typically, the cost function can be written as an average over the training set, such as J (θ) = E(x̂,y)∼p̂data L(f(x;θ), y), (8.1) where L is the per - example loss function, f(x;θ) is the predicted output when the input is x, p̂data is the empirical distribution.
- 固定搭配:无
- 句子分析:主从复合句,“where”引导的定语从句对前面的内容进行解释说明。句子介绍了成本函数通常可以写成训练集上的平均值,并给出了具体公式及相关概念的解释。
- 翻译:通常,成本函数可以写成训练集上的平均值,例如J(θ) = E(x̂,y)∼p̂data L(f(x;θ), y),(8.1)其中L是每个样本的损失函数,f(x;θ)是输入为x时的预测输出,p̂data是经验分布。
- 单词分析:
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- 记忆方法:联想 “empire”(帝国),帝国的建立往往基于经验,“-ical” 为形容词后缀。
- 形近词:empiricism(名词,经验主义)、empiric(名词,经验主义者)。
- 发音解析:
- 音节分解:em + pir + i + cal /ɪmˈpɪrɪkl/,重音在第二音节
- 规则:em → /ɪm/, “em” 发 /ɪm/ 音,其中 “e” 发短元音 /ɪ/,“m” 发 /m/ 音。
- 规则:pir → /pɪr/, “pir” 发 /pɪr/ 音,其中 “p” 发 /p/ 音,“i” 发短元音 /ɪ/,“r” 发 /r/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:cal → /kl/, “cal” 发 /kl/ 音,其中 “c” 发 /k/ 音,“a” 发短元音 /ə/,“l” 发 /l/ 音。
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- In the supervised learning case, y is the target output.
- 固定搭配:无
- 句子分析:简单句,主系表结构,说明在监督学习情况下,y是目标输出。
- 翻译:在监督学习的情况下,y是目标输出。
- 单词分析:
- supervised:形容词,词源来自 “supervise”(动词,监督;管理),词义:有监督的;受监督的。
- 记忆方法:联想 “super”(超级;在……之上)+ “vise”(看),在上面看着就是监督。
- 形近词:supervise(动词)、supervisor(名词,监督者;管理者)。
- 发音解析:
- 音节分解:su + per + vis + ed /ˈsuːpəvaɪzd/,重音在第一音节
- 规则:su → /suː/, “su” 发 /suː/ 音,其中 “s” 发 /s/ 音,“u” 发长元音 /uː/。
- 规则:per → /pə(r)/, “per” 发 /pə(r)/ 音,其中 “p” 发 /p/ 音,“e” 发短元音 /ə/,“r” 发音。
- 规则:vis → /vaɪz/, “vis” 发 /vaɪz/ 音,其中 “v” 发 /v/ 音,“i” 发长元音 /aɪ/,“s” 发 /z/ 音。
- 规则:ed → /d/, “ed” 发 /d/ 音。
- supervised:形容词,词源来自 “supervise”(动词,监督;管理),词义:有监督的;受监督的。
- Throughout this chapter, we develop the unregularized supervised case, where the arguments to L are f(x;θ) and y.
- 固定搭配:无
- 句子分析:主从复合句,“where”引导的定语从句修饰先行词 “unregularized supervised case”。句子表示在本章中,我们探讨无正则化的监督学习情况,其中L的参数是f(x;θ)和y。
- 翻译:在本章中,我们探讨无正则化的监督学习情况,其中L的参数是f(x;θ)和y。
- 单词分析:
- unregularized:形容词,词源来自 “regularize”(动词,使有规则;使规范化),“un-” 为否定前缀,词义:无正则化的。
- 记忆方法:联想 “regular”(规则的)+ “-ize”(动词后缀)+ “un-”(否定前缀)。
- 形近词:regularize(动词)、regular(形容词,规则的)。
- 发音解析:
- 音节分解:un + reg + u + lar + ize + d /ˌʌnˈreɡjəlaɪzd/,重音在第二音节
- 规则:un → /ʌn/, “un” 发 /ʌn/ 音,其中 “u” 发短元音 /ʌ/,“n” 发鼻音。
- 规则:reg → /reɡ/, “reg” 发 /reɡ/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɛ/,“g” 发 /ɡ/ 音。
- 规则:u → /juː/, “u” 发长元音 /juː/。
- 规则:lar → /lə(r)/, “lar” 发 /lə(r)/ 音,其中 “l” 发 /l/ 音,“a” 发短元音 /ə/,“r” 发音。
- 规则:ize → /aɪz/, “ize” 发 /aɪz/ 音,其中 “i” 发长元音 /aɪ/,“z” 发 /z/ 音。
- 规则:d → /d/, “d” 发 /d/ 音。
- unregularized:形容词,词源来自 “regularize”(动词,使有规则;使规范化),“un-” 为否定前缀,词义:无正则化的。
- arguments:名词复数,词源来自拉丁语 "arguere"(证明;争论),词义:参数;论据;争论。
- 记忆方法:联想 “argue”(争论)+ “-ment”(名词后缀)。
- 形近词:argue(动词)、argumentative(形容词,好争论的)。
- 发音解析:
- 音节分解:ar + gu + ment + s /ˈɑːɡjumənts/,重音在第一音节
- 规则:ar → /ɑː/, “ar” 发 /ɑː/ 音,其中 “a” 发长元音 /ɑː/,“r” 发 /r/ 音。
- 规则:gu → /ɡjuː/, “gu” 发 /ɡjuː/ 音,其中 “g” 发 /ɡ/ 音,“u” 发长元音 /juː/。
- 规则:ment → /mənt/, “ment” 发 /mənt/ 音,其中 “m” 发 /m/ 音,“e” 发短元音 /ə/,“n” 发 /n/ 音,“t” 发 /t/ 音。
- 规则:s → /s/, “s” 发 /s/ 音。
- However, it is trivial to extend this development, for example, to include θ or x as arguments, or to exclude y as arguments, in order to develop various forms of regularization or unsupervised learning.
- 固定搭配:"in order to"意为 "为了"。
- 句子分析:主从复合句,“it” 作形式主语,真正的主语是后面的 “to extend this development...” 部分。句子指出扩展这种发展很容易,比如包含或排除某些参数以实现不同形式的正则化或无监督学习。
- 翻译:然而,扩展这种发展很容易,例如,将θ或x作为参数包含进来,或者将y作为参数排除出去,以实现各种形式的正则化或无监督学习。
- 单词分析:
- trivial:形容词,词源来自拉丁语 "trivialis",原指三条路交汇的地方,引申为普通的、琐碎的,词义:琐碎的;微不足道的;容易的。
- 记忆方法:联想 “tri-”(三)+ “via”(路),三条路交汇的地方很普通,所以是琐碎的。
- 形近词:trivially(副词,琐碎地;轻易地)、trivia(名词,琐事; trivia问答游戏)。
- 发音解析:
- 音节分解:tri + vi + al /ˈtrɪviəl/,重音在第一音节
- 规则:tri → /traɪ/, “tri” 发 /traɪ/ 音,其中 “t” 发 /t/ 音,“r” 发 /r/ 音,“i” 发长元音 /aɪ/。
- 规则:vi → /vɪ/, “vi” 发 /vɪ/ 音,其中 “v” 发 /v/ 音,“i” 发短元音 /ɪ/。
- 规则:al → /əl/, “al” 发 /əl/ 音,其中 “a” 发短元音 /ə/,“l” 发 /l/ 音。
- trivial:形容词,词源来自拉丁语 "trivialis",原指三条路交汇的地方,引申为普通的、琐碎的,词义:琐碎的;微不足道的;容易的。
- extend:动词,词源来自拉丁语 "extendere",由 "ex-"(向外)+ "tendere"(伸展)构成,词义:扩展;延伸;延长。
- 记忆方法:联想 “ex-”(向外)+ “tend”(伸展),向外伸展就是扩展。
- 形近词:extension(名词,扩展;延伸)、extensive(形容词,广泛的)。
- 发音解析:
- 音节分解:ex + tend /ɪkˈstend/,重音在第二音节
- 规则:ex → /ɪkˈs/, “ex” 发 /ɪkˈs/ 音,其中 “e” 发短元音 /ɪ/,“x” 发 /s/ 音。
- 规则:tend → /tend/, “tend” 发 /tend/ 音,其中 “t” 发 /t/ 音,“e” 发短元音 /ɛ/,“n” 发 /n/ 音,“d” 发 /d/ 音。
- exclude:动词,词源来自拉丁语 "excludere",由 "ex-"(向外)+ "cludere"(关闭)构成,词义:排除;不包括。
- 记忆方法:联想 “ex-”(向外)+ “clude”(关闭),向外关闭就是排除。
- 形近词:exclusion(名词,排除;排斥)、include(动词,包括)。
- 发音解析:
- 音节分解:ex + clude /ɪkˈskluːd/,重音在第二音节
- 规则:ex → /ɪkˈs/, “ex” 发 /ɪkˈs/ 音,其中 “e” 发短元音 /ɪ/,“x” 发 /s/ 音。
- 规则:clude → /kluːd/, “clude” 发 /kluːd/ 音,其中 “c” 发 /k/ 音,“l” 发 /l/ 音,“u” 发长元音 /uː/,“d” 发 /d/ 音。
- regularization:名词,词源来自 “regularize”(动词,使有规则;使规范化),词义:正则化。
- 记忆方法:联想 “regular”(规则的)+ “-ize”(动词后缀)+ “-ation”(名词后缀)。
- 形近词:regularize(动词)、regular(形容词,规则的)。
- 发音解析:
- 音节分解:reg + u + lar + ize + a + tion /ˌreɡjələˈzeɪʃn/,重音在第三音节
- 规则:reg → /reɡ/, “reg” 发 /reɡ/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɛ/,“g” 发 /ɡ/ 音。
- 规则:u → /juː/, “u” 发长元音 /juː/。
- 规则:lar → /lə(r)/, “lar” 发 /lə(r)/ 音,其中 “l” 发 /l/ 音,“a” 发短元音 /ə/,“r” 发音。
- 规则:ize → /aɪz/, “ize” 发 /aɪz/ 音,其中 “i” 发长元音 /aɪ/,“z” 发 /z/ 音。
- 规则:a → /ə/, “a” 发短元音 /ə/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ə/,“o” 不发音,“n” 发鼻音。
- unsupervised:形容词,词源来自 “supervise”(动词,监督;管理),“un-” 为否定前缀,词义:无监督的。
- 记忆方法:联想 “supervise” + “un-”(否定前缀)。
- 形近词:supervise(动词)、supervised(形容词,有监督的)。
- 发音解析:
- 音节分解:un + su + per + vis + ed /ˌʌnsuːpəˈvaɪzd/,重音在第二音节
- 规则:un → /ʌn/, “un” 发 /ʌn/ 音,其中 “u” 发短元音 /ʌ/,“n” 发鼻音。
- 规则:su → /suː/, “su” 发 /suː/ 音,其中 “s” 发 /s/ 音,“u” 发长元音 /uː/。
- 规则:per → /pə(r)/, “per” 发 /pə(r)/ 音,其中 “p” 发 /p/ 音,“e” 发短元音 /ə/,“r” 发音。
- 规则:vis → /vaɪz/, “vis” 发 /vaɪz/ 音,其中 “v” 发 /v/ 音,“i” 发长元音 /aɪ/,“s” 发 /z/ 音。
- 规则:ed → /d/, “ed” 发 /d/ 音。
- Eq. 8.1 defines an objective function with respect to the training set.
- 固定搭配:"with respect to"意为 "关于;至于"。
- 句子分析:简单句,主谓宾结构,说明公式8.1定义了一个关于训练集的目标函数。
- 翻译:公式8.1定义了一个关于训练集的目标函数。
- 单词分析:
- defines:动词第三人称单数,词源来自拉丁语 "definire",由 "de-"(强调)+ "finire"(结束;限定)构成,词义:定义;规定。
- 记忆方法:联想 “de-”(强调)+ “fine”(边界),强调边界就是定义。
- 形近词:definition(名词,定义)、define(动词原形)。
- 发音解析:
- 音节分解:de + fines /dɪˈfaɪnz/,重音在第二音节
- 规则:de → /dɪ/, “de” 发 /dɪ/ 音,其中 “d” 发 /d/ 音,“e” 发短元音 /ɪ/。
- 规则:fines → /faɪnz/, “fines” 发 /faɪnz/ 音,其中 “f” 发 /f/ 音,“i” 发长元音 /aɪ/,“n” 发 /n/ 音,“e” 不发音,“s” 发 /z/ 音。
- defines:动词第三人称单数,词源来自拉丁语 "definire",由 "de-"(强调)+ "finire"(结束;限定)构成,词义:定义;规定。
- We would usually prefer to minimize the corresponding objective function where the expectation is taken across the data generating distribution pdata rather than just over the finite training set: J∗(θ) = E(x,y)∼pdata L(f(x;θ), y). (8.2)
- 固定搭配:"prefer to"意为 "更喜欢;宁愿";"rather than"意为 "而不是"。
- 句子分析:主从复合句,“where”引导的定语从句修饰先行词 “objective function”。句子表明我们通常更倾向于最小化在数据生成分布pdata上取期望的目标函数,而不仅仅是在有限的训练集上。
- 翻译:我们通常更倾向于最小化在数据生成分布pdata上取期望的目标函数,而不仅仅是在有限的训练集上:J∗(θ) = E(x,y)∼pdata L(f(x;θ), y)。(8.2)
- 单词分析:
- prefer:动词,词源来自拉丁语 "praeferre",由 "prae-"(在……之前)+ "ferre"(携带)构成,词义:更喜欢;宁愿。
- 记忆方法:联想 “pre-”(在……之前)+ “fer”(拿),在前面拿就是更喜欢。
- 形近词:preference(名词,偏好;偏爱)、preferable(形容词,更可取的;更好的)。
- 发音解析:
- 音节分解:pre + fer /prɪˈfɜː(r)/,重音在第二音节
- 规则:pre → /prɪ/, “pre” 发 /prɪ/ 音,其中 “p” 发 /p/ 音,“r” 发 /r/ 音,“e” 发短元音 /ɪ/。
- 规则:fer → /fɜː(r)/, “fer” 发 /fɜː(r)/ 音,其中 “f” 发 /f/ 音,“e” 发长元音 /ɜː/,“r” 发音。
- prefer:动词,词源来自拉丁语 "praeferre",由 "prae-"(在……之前)+ "ferre"(携带)构成,词义:更喜欢;宁愿。
- corresponding:形容词,词源来自 “correspond”(动词,符合;对应),词义:相应的;对应的。
- 记忆方法:联想 “cor-”(共同)+ “respond”(回应),共同回应就是对应。
- 形近词:correspond(动词)、correspondence(名词,通信;对应)。
- 发音解析:
- 音节分解:cor + re + spond + ing /ˌkɒrəˈspɒndɪŋ/,重音在第三音节
- 规则:cor → /kɒr/, “cor” 发 /kɒr/ 音,其中 “c” 发 /k/ 音,“o” 发短元音 /ɒ/,“r” 发 /r/ 音。
- 规则:re → /rɪ/, “re” 发 /rɪ/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɪ/。
- 规则:spond → /spɒnd/, “spond” 发 /spɒnd/ 音,其中 “s” 发 /s/ 音,“p” 发 /p/ 音,“o” 发短元音 /ɒ/,“n” 发 /n/ 音,“d” 发 /d/ 音。
- 规则:ing → /ɪŋ/, “ing” 发 /ɪŋ/ 音,其中 “i” 发短元音 /ɪ/,“n” 发鼻音,“g” 发音。
- expectation:名词,词源来自拉丁语 "expectare",由 "ex-"(向外)+ "spectare"(看)构成,词义:期望;预期。
- 记忆方法:联想 “ex-”(向外)+ “spect”(看),向外看就是期望。
- 形近词:expect(动词,期望)、expectant(形容词,期待的;预期的)。
- 发音解析:
- 音节分解:ex + pec + ta + tion /ˌekspekˈteɪʃn/,重音在第三音节
- 规则:ex → /eks/, “ex” 发 /eks/ 音,其中 “e” 发短元音 /ɛ/,“x” 发 /ks/ 音。
- 规则:pec → /pek/, “pec” 发 /pek/ 音,其中 “p” 发 /p/ 音,“e” 发短元音 /ɛ/,“c” 发 /k/ 音。
- 规则:ta → /teɪ/, “ta” 发 /teɪ/ 音,其中 “t” 发 /t/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ə/,“o” 不发音,“n” 发鼻音。
- generate:动词,词源来自拉丁语 "generare",词义:产生;生成。
- 记忆方法:联想 “gene”(基因),基因可以产生新的生命,所以 “generate” 有产生的意思。
- 形近词:generation(名词,一代;产生)、generator(名词,发电机;发生器)。
- 发音解析:
- 音节分解:gen + er + ate /ˈdʒenəreɪt/,重音在第一音节
- 规则:gen → /dʒen/, “gen” 发 /dʒen/ 音,其中 “g” 发 /dʒ/ 音,“e” 发短元音 /ɛ/,“n” 发 /n/ 音。
- 规则:er → /ə(r)/, “er” 发 /ə(r)/ 音,其中 “e” 发短元音 /ə/,“r” 发音。
- 规则:ate → /reɪt/, “ate” 发 /reɪt/ 音,其中 “a” 发长元音 /eɪ/,“t” 发 /t/ 音。
- 8.1.1 Empirical Risk Minimization
- 固定搭配:无
- 句子分析:这是一个标题,表明8.1.1节的主题是经验风险最小化。
- 翻译:8.1.1 经验风险最小化
- 单词分析:
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- 记忆方法:联想 “empire”(帝国),帝国的建立往往基于经验,“-ical” 为形容词后缀。
- 形近词:empiricism(名词,经验主义)、empiric(名词,经验主义者)。
- 发音解析:
- 音节分解:em + pir + i + cal /ɪmˈpɪrɪkl/,重音在第二音节
- 规则:em → /ɪm/, “em” 发 /ɪm/ 音,其中 “e” 发短元音 /ɪ/,“m” 发 /m/ 音。
- 规则:pir → /pɪr/, “pir” 发 /pɪr/ 音,其中 “p” 发 /p/ 音,“i” 发短元音 /ɪ/,“r” 发 /r/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:cal → /kl/, “cal” 发 /kl/ 音,其中 “c” 发 /k/ 音,“a” 发短元音 /ə/,“l” 发 /l/ 音。
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- risk:名词,词源来自意大利语 "risco",词义:风险;危险。
- 记忆方法:联想 “risky”(形容词,危险的),去掉 “-y” 就是 “risk”。
- 形近词:risky(形容词)、riskless(形容词,无风险的)。
- 发音解析:
- 音节分解:risk /rɪsk/,重音在第一音节
- 规则:r → /r/, “r” 发 /r/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:sk → /sk/, “sk” 发 /sk/ 音,其中 “s” 发 /s/ 音,“k” 发 /k/ 音。
- minimization:名词,词源来自 “minimize”(动词,使最小化),词义:最小化。
- 记忆方法:联想 “mini”(小的)+ “-ize”(动词后缀)+ “-ation”(名词后缀)。
- 形近词:minimize(动词)、minimum(名词,最小值;形容词,最小的)。
- 发音解析:
- 音节分解:min + i + mize + a + tion /ˌmɪnɪmaɪˈzeɪʃn/,重音在第三音节
- 规则:min → /mɪn/, “min” 发 /mɪn/ 音,其中 “m” 发 /m/ 音,“i” 发短元音 /ɪ/,“n” 发 /n/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:mize → /maɪz/, “mize” 发 /maɪz/ 音,其中 “m” 发 /m/ 音,“i” 发长元音 /aɪ/,“z” 发 /z/ 音。
- 规则:a → /ə/, “a” 发短元音 /ə/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ə/,“o” 不发音,“n” 发鼻音。
- The goal of a machine learning algorithm is to reduce the expected generalization error given by Eq.
- 固定搭配:无
- 句子分析:主系表结构的简单句,说明机器学习算法的目标是减少由某个公式给出的预期泛化误差。
- 翻译:机器学习算法的目标是减少由某个公式给出的预期泛化误差。
- 单词分析:
- generalization:名词,词源来自 “generalize”(动词,概括;推广;泛化),词义:泛化;概括;推广。
- 记忆方法:联想 “general”(普遍的;一般的)+ “-ize”(动词后缀)+ “-ation”(名词后缀)。
- 形近词:generalize(动词)、general(形容词,普遍的;一般的)。
- 发音解析:
- 音节分解:gen + er + al + ize + a + tion /ˌdʒenərəlaɪˈzeɪʃn/,重音在第三音节
- 规则:gen → /dʒen/, “gen” 发 /dʒen/ 音,其中 “g” 发 /dʒ/ 音,“e” 发短元音 /ɛ/,“n” 发 /n/ 音。
- 规则:er → /ə(r)/, “er” 发 /ə(r)/ 音,其中 “e” 发短元音 /ə/,“r” 发音。
- 规则:al → /əl/, “al” 发 /əl/ 音,其中 “a” 发短元音 /ə/,“l” 发 /l/ 音。
- 规则:ize → /aɪz/, “ize” 发 /aɪz/ 音,其中 “i” 发长元音 /aɪ/,“z” 发 /z/ 音。
- 规则:a → /ə/, “a” 发短元音 /ə/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ə/,“o” 不发音,“n” 发鼻音。
- generalization:名词,词源来自 “generalize”(动词,概括;推广;泛化),词义:泛化;概括;推广。
- This quantity is known as the 8.2 risk. We emphasize here that the expectation is taken over the true underlying distribution p data.
- 固定搭配:"is known as"意为 "被称为;被认为是"。
- 句子分析:前半句是简单句,“This quantity” 是主语,“is known as” 是谓语;后半句 “We emphasize here that...” 是主从复合句,“that” 引导宾语从句。
- 翻译:"这个数量被称为 8.2 风险。我们在此强调,期望是基于真实的底层分布 p data 计算的。"
- 单词分析:
- quantity:名词,词源来自拉丁语 "quantitas",词义:数量;大量。
- 记忆方法:联想 “quant”(表示数量)+ “ity”(名词后缀)→ 数量。
- 形近词:quantity/qualify(使具备资格)、quality(质量)。
- 发音解析:
- 音节分解:quan + ti + ty /ˈkwɑːntəti/,重音在第一音节
- 规则:quan → /kwɑːn/, “quan” 发 /kwɑːn/ 音,其中 “qu” 发 /kw/ 音,“a” 发长元音 /ɑː/。
- 规则:ti → /tɪ/, “ti” 发短音 /tɪ/,类似于 “tip” 的发音。
- 规则:ty → /ti/, “ty” 发 /ti/ 音,其中 “t” 发 /t/ 音,“y” 发 /i/ 音。
- quantity:名词,词源来自拉丁语 "quantitas",词义:数量;大量。
- underlying:形容词,词源是 “underlie”(位于……之下;构成……的基础)的现在分词形式,词义:潜在的;根本的。
- 记忆方法:“under”(在……之下)+ “lie”(躺)→ 躺在下面的 → 潜在的。
- 形近词:underlying/underlie(动词原形)、underline(下划线;强调)。
- 发音解析:
- 音节分解:un + der + ly + ing /ˌʌndərˈlaɪɪŋ/,重音在第二音节
- 规则:un → /ʌn/, “un” 发 /ʌn/ 音,其中 “u” 发短元音 /ʌ/,“n” 发鼻音。
- 规则:der → /dər/, “der” 发 /dər/ 音,其中 “d” 发 /d/ 音,“e” 发短元音 /ə/,“r” 发 /r/ 音。
- 规则:ly → /laɪ/, “ly” 发 /laɪ/ 音,类似于 “lie” 的发音。
- 规则:ing → /ɪŋ/, “ing” 发 /ɪŋ/ 音,其中 “i” 发短元音 /ɪ/,“ng” 发 /ŋ/ 音。
- If we knew the true distribution p data ( x, y ), risk minimization would be an optimization task solvable by an optimization algorithm.
- 固定搭配:无
- 句子分析:这是一个虚拟语气的条件状语从句,“If” 引导条件从句,“risk minimization would be...” 是主句。
- 翻译:"如果我们知道真实的分布 p data (x, y),风险最小化将是一个可以通过优化算法解决的优化任务。"
- 单词分析:
- minimization:名词,词源是 “minimize”(使最小化)的名词形式,词义:最小化。
- 记忆方法:“mini”(小的)+ “mize”(动词后缀)+ “ation”(名词后缀)→ 使变小 → 最小化。
- 形近词:minimization/minimize(动词)、maximum(最大值)。
- 发音解析:
- 音节分解:min + i + mi + za + tion /ˌmɪnɪmaɪˈzeɪʃn/,重音在第三音节
- 规则:min → /mɪn/, “min” 发 /mɪn/ 音,其中 “m” 发 /m/ 音,“i” 发短元音 /ɪ/,“n” 发鼻音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:mi → /maɪ/, “mi” 发 /maɪ/ 音,类似于 “my” 的发音。
- 规则:za → /zeɪ/, “za” 发 /zeɪ/ 音,其中 “z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“ion” 发 /ʃn/ 音。
- minimization:名词,词源是 “minimize”(使最小化)的名词形式,词义:最小化。
- optimization:名词,词源是 “optimize”(优化)的名词形式,词义:优化;最佳化。
- 记忆方法:“optim”(最好的)+ “ize”(动词后缀)+ “ation”(名词后缀)→ 使达到最好 → 优化。
- 形近词:optimization/optimize(动词)、optimum(最佳的)。
- 发音解析:
- 音节分解:op + ti + mi + za + tion /ˌɑːptɪmaɪˈzeɪʃn/,重音在第三音节
- 规则:op → /ɑːp/, “op” 发 /ɑːp/ 音,其中 “o” 发长元音 /ɑː/,“p” 发 /p/ 音。
- 规则:ti → /tɪ/, “ti” 发短音 /tɪ/,
- 类似于 “tip” 的发音。
- 规则:mi → /maɪ/, “mi” 发 /maɪ/ 音,类似于 “my” 的发音。
- 规则:za → /zeɪ/, “za” 发 /zeɪ/ 音,其中 “z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“ion” 发 /ʃn/ 音。
- However, when we do not know p data ( x, y ) but only have a training set of samples, we have a machine learning problem.
- 固定搭配:无
- 句子分析:“when” 引导时间状语从句,“but” 连接两个并列的情况,主句是 “we have a machine learning problem”。
- 翻译:"然而,当我们不知道 p data (x, y) 而只有一组训练样本时,我们就面临一个机器学习问题。"
- The simplest way to convert a machine learning problem back into an optimization problem is to minimize the expected loss on the training set.
- 固定搭配:"convert... into..."意为 "把……转化为……"。
- 句子分析:句子主干是 “The simplest way... is to minimize...”,“to convert...” 是后置定语修饰 “way”。
- 翻译:"将机器学习问题转化回优化问题的最简单方法是最小化训练集上的预期损失。"
- 单词分析:
- convert:动词,词源来自拉丁语 "convertre",词义:转变;转换。
- 记忆方法:“con”(共同)+ “vert”(转)→ 一起转 → 转变。
- 形近词:convert/converse(交谈;相反的)、invert(使颠倒)。
- 发音解析:
- 音节分解:con + vert /kənˈvɜːrt/,重音在第二音节
- 规则:con → /kən/, “con” 发 /kən/ 音,其中 “c” 发 /k/ 音,“o” 发短元音 /ə/。
- 规则:vert → /vɜːrt/, “vert” 发 /vɜːrt/ 音,其中 “v” 发 /v/ 音,“er” 发长元音 /ɜːr/,“t” 发 /t/ 音。
- convert:动词,词源来自拉丁语 "convertre",词义:转变;转换。
- This means replacing the true distribution p ( x, y ) with the empirical distribution ˆ p ( x, y ) defined by the training set.
- 固定搭配:"replace... with..."意为 "用……替换……"。
- 句子分析:“This” 指代前面提到的内容,“replacing... with...” 是动名词短语作宾语。
- 翻译:"这意味着用训练集定义的经验分布 ˆ p (x, y) 替换真实分布 p (x, y)。"
- 单词分析:
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- 记忆方法:联想 “em”(进入)+ “pir”(尝试)+ “ical”(形容词后缀)→ 进入尝试 → 基于经验的。
- 形近词:empirical/empiricism(经验主义)、imperial(帝国的)。
- 发音解析:
- 音节分解:em + pir + i + cal /ɪmˈpɪrɪkl/,重音在第二音节
- 规则:em → /ɪm/, “em” 发 /ɪm/ 音,其中 “e” 发短元音 /ɪ/,“m” 发 /m/ 音。
- 规则:pir → /pɪr/, “pir” 发 /pɪr/ 音,其中 “p” 发 /p/ 音,“i” 发短元音 /ɪ/,“r” 发 /r/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:cal → /kl/, “cal” 发 /kl/ 音,其中 “c” 发 /k/ 音,“a” 不发音,“l” 发 /l/ 音。
- empirical:形容词,词源来自希腊语 "empeiria"(经验),词义:经验主义的;基于经验的。
- We now minimize the empirical risk E x, y ∼ ˆ p data ( ) x, y [ ( ( ; ) )] = L f x θ, y 1 m m i =1 L f ( ( x ( ) i ; ) θ, y ( ) i ) (8.3) where m is the number of training examples.
- 固定搭配:无
- 句子分析:句子主干是 “We minimize the empirical risk...”,“where” 引导定语从句修饰前面的内容。
- 翻译:"我们现在最小化经验风险 E x, y ∼ ˆ p data ( ) x, y [ ( ( ; ) )] = L f x θ, y 1 m m i =1 L f ( ( x ( ) i ; ) θ, y ( ) i ) (8.3),其中 m 是训练示例的数量。"
- The training process based on minimizing this average training error is known as empirical risk minimization.
- 固定搭配:"be known as"意为 "被称为;被认为是"。
- 句子分析:句子主干是 “The training process... is known as...”,“based on...” 是后置定语修饰 “process”。
- 翻译:"基于最小化这种平均训练误差的训练过程被称为经验风险最小化。"
- In this setting, machine learning is still very similar to straightforward optimization.
- 固定搭配:"be similar to"意为 "与……相似"。
- 句子分析:简单句,“machine learning” 是主语,“is” 是谓语。
- 翻译:"在这种情况下,机器学习仍然与直接的优化非常相似。"
- 单词分析:
- straightforward:形容词,词源是 “straight”(直的)+ “forward”(向前),词义:直接的;坦率的。
- 记忆方法:“straight”(直的)+ “forward”(向前)→ 直着向前的 → 直接的。
- 形近词:straightforward/straight(直的)、forward(向前的)。
- 发音解析:
- 音节分解:straight + for + ward /ˌstreɪtfɔːrwərd/,重音在第一音节
- 规则:straight → /streɪt/, “straight” 发 /streɪt/ 音,其中 “str” 发 /str/ 音,“ai” 发长元音 /eɪ/,“ght” 发 /t/ 音。
- 规则:for → /fɔːr/, “for” 发 /fɔːr/ 音,其中 “f” 发 /f/ 音,“o” 发长元音 /ɔː/,“r” 发 /r/ 音。
- 规则:ward → /wərd/, “ward” 发 /wərd/ 音,其中 “w” 发 /w/ 音,“a” 发短元音 /ə/,“r” 发 /r/ 音,“d” 发 /d/ 音。
- straightforward:形容词,词源是 “straight”(直的)+ “forward”(向前),词义:直接的;坦率的。
- Rather than optimizing the risk directly, we optimize the empirical risk, and hope that the risk decreases significantly as well.
- 固定搭配:"rather than"意为 "而不是"。
- 句子分析:“Rather than...” 作比较状语,“we” 是主语,有 “optimize” 和 “hope” 两个并列的谓语,“that” 引导 “hope” 的宾语从句。
- 翻译:"我们不是直接优化风险,而是优化经验风险,并希望风险也能显著降低。"
- 单词分析:
- significantly:副词,词源是 “significant”(重要的;显著的)的副词形式,词义:显著地;重要地。
- 记忆方法:“sign”(标记)+ “i” + “fic”(做)+ “ant”(形容词后缀)+ “ly”(副词后缀)→ 做标记的 → 显著的 → 显著地。
- 形近词:significantly/significant(形容词)、signify(表示;意味着)。
- 发音解析:
- 音节分解:sig + ni + fi + cant + ly /sɪɡˈnɪfɪkəntli/,重音在第二音节
- 规则:sig → /sɪɡ/, “sig” 发 /sɪɡ/ 音,其中 “s” 发 /s/ 音,“i” 发短元音 /ɪ/,“g” 发 /ɡ/ 音。
- 规则:ni → /nɪ/, “ni” 发 /nɪ/ 音,其中 “n” 发 /n/ 音,“i” 发短元音 /ɪ/。
- 规则:fi → /fɪ/, “fi” 发 /fɪ/ 音,其中 “f” 发 /f/ 音,“i” 发短元音 /ɪ/。
- 规则:cant → /kənt/, “cant” 发 /kənt/ 音,其中 “c” 发 /k/ 音,“a” 发短元音 /ə/,“n” 发 /n/ 音,“t” 发 /t/ 音。
- 规则:ly → /li/, “ly” 发 /li/ 音,其中 “l” 发 /l/ 音,“y” 发 /i/ 音。
- significantly:副词,词源是 “significant”(重要的;显著的)的副词形式,词义:显著地;重要地。
- A variety of theoretical results establish conditions under which the true risk can be expected to decrease by various amounts.
- 固定搭配:“a variety of”意为“各种各样的”;“under which”引导定语从句,修饰先行词“conditions”。
- 句子分析:主从复合句,“A variety of theoretical results”是主语,“establish”是谓语,“conditions”是宾语,“under which...”是定语从句,修饰“conditions”。
- 翻译:各种各样的理论结果确立了一些条件,在这些条件下,真实风险有望以不同的幅度降低。
- 单词分析:
- theoretical:形容词,词源来自希腊语“theorein”(观察、思考),词义:理论的。
- 记忆方法:“theory”(理论)+“-ical”(形容词后缀)→理论的。
- 形近词:theoretical/theory(理论)、theorist(理论家)。
- 发音解析:
- 音节分解:the + o + ret + i + cal /ˌθiːəˈretɪkl/,重音在第二音节
- 规则:the → /θiː/, “the” 发 /θiː/ 音,其中 “th” 发 /θ/ 音,“e” 发长元音 /iː/。
- 规则:o → /ə/, “o” 发短元音 /ə/。
- 规则:ret → /ret/, “ret” 发 /ret/ 音,其中 “r” 发 /r/ 音,“e” 发短元音 /ɛ/,“t” 发 /t/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:cal → /kl/, “cal” 发 /kl/ 音,其中 “c” 发 /k/ 音,“a” 不发音,“l” 发 /l/ 音。
- theoretical:形容词,词源来自希腊语“theorein”(观察、思考),词义:理论的。
- However, empirical risk minimization is prone to overfitting.
- 固定搭配:“be prone to”意为“易于;倾向于”。
- 句子分析:简单句,“empirical risk minimization”是主语,“is”是系动词,“prone to overfitting”是表语。
- 翻译:然而,经验风险最小化容易导致过拟合。
- 单词分析:
- empirical:形容词,词源来自希腊语“empeiria”(经验),词义:经验主义的;基于经验的。
- 记忆方法:“em-”(进入)+“pir”(尝试)+“-ical”(形容词后缀)→进入尝试→基于经验的。
- 形近词:empirical/empiricism(经验主义)、empiric(经验主义者)。
- 发音解析:
- 音节分解:em + pir + i + cal /ɪmˈpɪrɪkl/,重音在第二音节
- 规则:em → /ɪm/, “em” 发 /ɪm/ 音,其中 “e” 发短元音 /ɪ/,“m” 发鼻音。
- 规则:pir → /pɪr/, “pir” 发 /pɪr/ 音,其中 “p” 发 /p/ 音,“i” 发短元音 /ɪ/,“r” 发 /r/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:cal → /kl/, “cal” 发 /kl/ 音,其中 “c” 发 /k/ 音,“a” 不发音,“l” 发 /l/ 音。
- empirical:形容词,词源来自希腊语“empeiria”(经验),词义:经验主义的;基于经验的。
- minimization:名词,词源来自“minimize”(使最小化),词义:最小化。
- 记忆方法:“minimize”(使最小化)+“-ation”(名词后缀)→最小化。
- 形近词:minimization/minimize(使最小化)、minimum(最小值)。
- 发音解析:
- 音节分解:min + i + mi + za + tion /ˌmɪnɪmaɪˈzeɪʃn/,重音在第三音节
- 规则:min → /mɪn/, “min” 发 /mɪn/ 音,其中 “m” 发 /m/ 音,“i” 发短元音 /ɪ/,“n” 发鼻音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:mi → /maɪ/, “mi” 发 /maɪ/ 音,其中 “m” 发 /m/ 音,“i” 发长元音 /aɪ/。
- 规则:za → /zeɪ/, “za” 发 /zeɪ/ 音,其中 “z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ɪ/,“o” 不发音,“n” 发鼻音。
- overfitting:名词,由“over-”(过度)+“fitting”(拟合)组成,词义:过拟合。
- 记忆方法:“over-”(过度)+“fitting”(拟合)→过拟合。
- 形近词:overfitting/overdo(过度做)、overload(超载)。
- 发音解析:
- 音节分解:o + ver + fit + ting /ˈəʊvəfɪtɪŋ/,重音在第一音节
- 规则:o → /əʊ/, “o” 发长元音 /əʊ/。
- 规则:ver → /və/, “ver” 发 /və/ 音,其中 “v” 发 /v/ 音,“e” 发短元音 /ə/。
- 规则:fit → /fɪt/, “fit” 发 /fɪt/ 音,其中 “f” 发 /f/ 音,“i” 发短元音 /ɪ/,“t” 发 /t/ 音。
- 规则:ting → /tɪŋ/, “ting” 发 /tɪŋ/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/,“ng” 发 /ŋ/ 音。
- Models with high capacity can simply memorize the training set.
- 句子分析:简单句,“Models”是主语,“with high capacity”是后置定语修饰“Models”,“can memorize”是谓语,“the training set”是宾语。
- 翻译:高容量的模型可以简单地记住训练集。
- 单词分析:
- capacity:名词,词源来自拉丁语“capacitas”(容量),词义:容量;能力。
- 记忆方法:“cap”(拿、抓)+“-acity”(名词后缀)→能拿的量→容量。
- 形近词:capacity/capable(有能力的)、capacitance(电容)。
- 发音解析:
- 音节分解:ca + pac + i + ty /kəˈpæsəti/,重音在第二音节
- 规则:ca → /kə/, “ca” 发 /kə/ 音,其中 “c” 发 /k/ 音,“a” 发短元音 /ə/。
- 规则:pac → /pæs/, “pac” 发 /pæs/ 音,其中 “p” 发 /p/ 音,“a” 发短元音 /æ/,“c” 发 /s/ 音。
- 规则:i → /ɪ/, “i” 发短元音 /ɪ/。
- 规则:ty → /ti/, “ty” 发 /ti/ 音,其中 “t” 发 /t/ 音,“y” 发 /i/ 音。
- capacity:名词,词源来自拉丁语“capacitas”(容量),词义:容量;能力。
- In many cases, empirical risk minimization is not really feasible.
- 固定搭配:“in many cases”意为“在很多情况下”。
- 句子分析:简单句,“empirical risk minimization”是主语,“is”是系动词,“not really feasible”是表语。
- 翻译:在很多情况下,经验风险最小化实际上并不可行。
- 单词分析:
- feasible:形容词,词源来自拉丁语“facere”(做),词义:可行的;可能的。
- 记忆方法:“feas”(做)+“-ible”(可……的)→可做的→可行的。
- 形近词:feasible/feasibility(可行性)、infeasible(不可行的)。
- 发音解析:
- 音节分解:fea + si + ble /ˈfiːzəbl/,重音在第一音节
- 规则:fea → /fiː/, “fea” 发 /fiː/ 音,其中 “f” 发 /f/ 音,“e” 发长元音 /iː/,“a” 不发音。
- 规则:si → /zə/, “si” 发 /zə/ 音,其中 “s” 发 /z/ 音,“i” 发短元音 /ə/。
- 规则:ble → /bl/, “ble” 发 /bl/ 音,其中 “b” 发 /b/ 音,“l” 发 /l/ 音。
- feasible:形容词,词源来自拉丁语“facere”(做),词义:可行的;可能的。
- The most effective modern optimization algorithms are based on gradient descent, but many useful loss functions, such as 0 - 1 loss, have no useful derivatives (the derivative is either zero or undefined everywhere).
- 固定搭配:“be based on”意为“基于”;“gradient descent”意为“梯度下降”。
- 句子分析:并列复合句,由“but”连接两个分句。前一个分句中,“The most effective modern optimization algorithms”是主语,“are based on”是谓语;后一个分句中,“many useful loss functions”是主语,“have”是谓语。
- 翻译:最有效的现代优化算法基于梯度下降,但许多有用的损失函数,如0 - 1损失,没有有用的导数(导数要么为零,要么处处无定义)。
- 单词分析:
- effective:形容词,词源来自拉丁语“effectus”(效果),词义:有效的。
- 记忆方法:“effect”(效果)+“-ive”(形容词后缀)→有效果的→有效的。
- 形近词:effective/effect(效果)、ineffective(无效的)。
- 发音解析:
- 音节分解:ef + fec + tive /ɪˈfektɪv/,重音在第二音节
- 规则:ef → /ɪf/, “ef” 发 /ɪf/ 音,其中 “e” 发短元音 /ɪ/,“f” 发 /f/ 音。
- 规则:fec → /ek/, “fec” 发 /ek/ 音,其中 “f” 发 /f/ 音,“e” 发短元音 /ɛ/,“c” 发 /k/ 音。
- 规则:tive → /tɪv/, “tive” 发 /tɪv/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/,“v” 发 /v/ 音。
- effective:形容词,词源来自拉丁语“effectus”(效果),词义:有效的。
- optimization:名词,词源来自“optimize”(优化),词义:优化。
- 记忆方法:“optimize”(优化)+“-ation”(名词后缀)→优化。
- 形近词:optimization/optimize(优化)、optimal(最优的)。
- 发音解析:
- 音节分解:op + ti + mi + za + tion /ˌɒptɪmaɪˈzeɪʃn/,重音在第三音节
- 规则:op → /ɒp/, “op” 发 /ɒp/ 音,其中 “o” 发短元音 /ɒ/,“p” 发 /p/ 音。
- 规则:ti → /tɪ/, “ti” 发 /tɪ/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/。
- 规则:mi → /maɪ/, “mi” 发 /maɪ/ 音,其中 “m” 发 /m/ 音,“i” 发长元音 /aɪ/。
- 规则:za → /zeɪ/, “za” 发 /zeɪ/ 音,其中 “z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ɪ/,“o” 不发音,“n” 发鼻音。
- derivative:名词,词源来自拉丁语“derivare”(派生),词义:导数;衍生物。
- 记忆方法:“de-”(离开)+“riv”(河流)+“-ative”(形容词后缀)→从河流分流出来的→衍生物;导数。
- 形近词:derivative/derive(派生)、derivation(派生;推导)。
- 发音解析:
- 音节分解:de + ri + va + tive /dɪˈrɪvətɪv/,重音在第二音节
- 规则:de → /dɪ/, “de” 发 /dɪ/ 音,其中 “d” 发 /d/ 音,“e” 发短元音 /ɪ/。
- 规则:ri → /rɪ/, “ri” 发 /rɪ/ 音,其中 “r” 发 /r/ 音,“i” 发短元音 /ɪ/。
- 规则:va → /və/, “va” 发 /və/ 音,其中 “v” 发 /v/ 音,“a” 发短元音 /ə/。
- 规则:tive → /tɪv/, “tive” 发 /tɪv/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/,“v” 发 /v/ 音。
- These two problems mean that, in the context of deep learning, we rarely use empirical risk minimization.
- 固定搭配:“in the context of”意为“在……的背景下”。
- 句子分析:主从复合句,“These two problems”是主语,“mean”是谓语,“that...”引导宾语从句。
- 翻译:这两个问题意味着,在深度学习的背景下,我们很少使用经验风险最小化。
- Instead, we must use a slightly different approach, in which the quantity that we actually optimize is even more different from the quantity that we truly want to optimize.
- 固定搭配:“be different from”意为“与……不同”。
- 句子分析:主从复合句,“we”是主语,“must use”是谓语,“a slightly different approach”是宾语,“in which...”引导定语从句,其中又包含两个“that”引导的定语从句分别修饰“quantity”。
- 翻译:相反,我们必须采用一种稍有不同的方法,在这种方法中,我们实际优化的量与我们真正想要优化的量差异更大。
- 单词分析:
- quantity:名词,词源来自拉丁语“quantitas”(数量),词义:数量;量。
- 记忆方法:“quant”(数量)+“-ity”(名词后缀)→数量。
- 形近词:quantity/quantify(量化)、quantitative(定量的)。
- 发音解析:
- 音节分解:qu + an + ti + ty /ˈkwɒntəti/,重音在第一音节
- 规则:qu → /kw/, “qu” 发 /kw/ 音,其中 “q” 发 /k/ 音,“u” 发 /w/ 音。
- 规则:an → /æn/, “an” 发 /æn/ 音,其中 “a” 发短元音 /æ/,“n” 发鼻音。
- 规则:ti → /tɪ/, “ti” 发 /tɪ/ 音,其中 “t” 发 /t/ 音,“i” 发短元音 /ɪ/。
- 规则:ty → /ti/, “ty” 发 /ti/ 音,其中 “t” 发 /t/ 音,“y” 发 /i/ 音。
- quantity:名词,词源来自拉丁语“quantitas”(数量),词义:数量;量。
- 8.1.2 Surrogate Loss Functions and Early Stopping
- 翻译:8.1.2 替代损失函数与提前停止
- Sometimes, the loss function we actually care about (say classification error) is not one that can be optimized efficiently.
- 句子分析:主从复合句,“the loss function”是主语,“we actually care about”是定语从句修饰“the loss function”,“is”是系动词,“not one”是表语,“that can be optimized efficiently”是定语从句修饰“one”。
- 翻译:有时,我们实际关心的损失函数(比如分类误差)并不是一个可以有效优化的函数。
- 单词分析:
- surrogate:名词,词源来自拉丁语“surrogatus”(替代),词义:替代物;代理。
- 记忆方法:“sur-”(在……之上)+“rog”(要求)+“-ate”(动词后缀)→在上面要求别人做→替代。
- 形近词:surrogate/surrogacy(代孕)、surround(围绕)。
- 发音解析:
- 音节分解:sur + ro + gate /ˈsʌrəɡeɪt/,重音在第一音节
- 规则:sur → /sʌr/, “sur” 发 /sʌr/ 音,其中 “s” 发 /s/ 音,“u” 发短元音 /ʌ/,“r” 发 /r/ 音。
- 规则:ro → /rə/, “ro” 发 /rə/ 音,其中 “r” 发 /r/ 音,“o” 发短元音 /ə/。
- 规则:gate → /ɡeɪt/, “gate” 发 /ɡeɪt/ 音,其中 “g” 发 /ɡ/ 音,“a” 发长元音 /eɪ/,“t” 发 /t/ 音。
- surrogate:名词,词源来自拉丁语“surrogatus”(替代),词义:替代物;代理。
- efficiently:副词,词源来自“efficient”(有效率的),词义:有效地。
- 记忆方法:“efficient”(有效率的)+“-ly”(副词后缀)→有效地。
- 形近词:efficiently/efficient(有效率的)、inefficiently(无效率地)。
- 发音解析:
- 音节分解:ef + fi + cient + ly /ɪˈfɪʃntli/,重音在第二音节
- 规则:ef → /ɪf/, “ef” 发 /ɪf/ 音,其中 “e” 发短元音 /ɪ/,“f” 发 /f/ 音。
- 规则:fi → /fɪ/, “fi” 发 /fɪ/ 音,其中 “f” 发 /f/ 音,“i” 发短元音 /ɪ/。
- 规则:cient → /ʃnt/, “cient” 发 /ʃnt/ 音,其中 “c” 发 /ʃ/ 音,“i” 发短元音 /ɪ/,“e” 不发音,“n” 发鼻音,“t” 发 /t/ 音。
- 规则:ly → /li/, “ly” 发 /li/ 音,其中 “l” 发 /l/ 音,“y” 发 /i/ 音。
- For example, exactly minimizing expected 0 - 1 loss is typically intractable (exponential in the input dimension), even for a linear classifier (Marcotte and Savard 1992, ).
- 句子分析:主从复合句,“exactly minimizing expected 0 - 1 loss”是主语,“is”是系动词,“typically intractable”是表语。
- 翻译:例如,精确地最小化预期的0 - 1损失通常是难以处理的(输入维度呈指数级增长),即使对于线性分类器也是如此(Marcotte和Savard,1992)。
- 单词分析:
- intractable:形容词,词源来自拉丁语“intractabilis”(难处理的),词义:难处理的;棘手的。
- 记忆方法:“in-”(否定)+“tract”(拉、拖)+“-able”(可……的)→不可拉的→难处理的。
- 形近词:intractable/tractable(易处理的)、extract(提取)。
- 发音解析:
- 音节分解:in + trac + table /ɪnˈtræktəbl/,重音在第二音节
- 规则:in → /ɪn/, “in” 发 /ɪn/ 音,其中 “i” 发短元音 /ɪ/,“n” 发鼻音。
- 规则:trac → /træk/, “trac” 发 /træk/ 音,其中 “t” 发 /t/ 音,“r” 发 /r/ 音,“a” 发短元音 /æ/,“c” 发 /k/ 音。
- 规则:table → /təbl/, “table” 发 /təbl/ 音,其中 “t” 发 /t/ 音,“a” 发短元音 /ə/,“b” 发 /b/ 音,“l” 发 /l/ 音。
- intractable:形容词,词源来自拉丁语“intractabilis”(难处理的),词义:难处理的;棘手的。
- exponential:形容词,词源来自拉丁语“exponere”(展开),词义:指数的;迅速增长的。
- 记忆方法:“ex-”(向外)+“pon”(放置)+“-ential”(形容词后缀)→向外放置→指数增长的。
- 形近词:exponential/exponent(指数)、exponentiate(使成指数)。
- 发音解析:
- 音节分解:ex + po + nen + tial /ˌekspəˈnenʃl/,重音在第三音节
- 规则:ex → /eks/, “ex” 发 /eks/ 音,其中 “e” 发短元音 /ɛ/,“x” 发 /ks/ 音。
- 规则:po → /pə/, “po” 发 /pə/ 音,其中 “p” 发 /p/ 音,“o” 发短元音 /ə/。
- 规则:nen → /nen/, “nen” 发 /nen/ 音,其中 “n” 发鼻音,“e” 发短元音 /ɛ/,“n” 发鼻音。
- 规则:tial → /ʃl/, “tial” 发 /ʃl/ 音,其中 “t” 不发音,“i” 发短元音 /ɪ/,“a” 不发音,“l” 发 /l/ 音。
- In such situations, one typically optimizes a surrogate loss function instead, which acts as a proxy but has advantages.
- 固定搭配:“act as”意为“充当;作为”。
- 句子分析:主从复合句,“one”是主语,“optimizes”是谓语,“a surrogate loss function”是宾语,“which...”引导非限定性定语从句,修饰“a surrogate loss function”。
- 翻译:在这种情况下,人们通常会优化一个替代损失函数,它可以作为代理,但有一些优势。
- 单词分析:
- proxy:名词,词源来自拉丁语“procurare”(代理),词义:代理;代理人。
- 记忆方法:“pro-”(向前)+“xy”(想成“代理”的拼音)→向前代理→代理。
- 形近词:proxy/proximal(接近的)、proximity(接近)。
- 发音解析:
- 音节分解:pro + xy /ˈprɒksi/,重音在第一音节
- 规则:pro → /prɒ/, “pro” 发 /prɒ/ 音,其中 “p” 发 /p/ 音,“r” 发 /r/ 音,“o” 发短元音 /ɒ/。
- 规则:xy → /ksi/, “xy” 发 /ksi/ 音,其中 “x” 发 /ks/ 音,“y” 发 /i/ 音。
- proxy:名词,词源来自拉丁语“procurare”(代理),词义:代理;代理人。
- For example, the negative log - likelihood of the correct class is typically used as a surrogate for the 0 - 1 loss.
- 固定搭配:“be used as”意为“被用作”。
- 句子分析:简单句,“the negative log - likelihood of the correct class”是主语,“is used”是谓语。
- 翻译:例如,正确类别的负对数似然通常被用作0 - 1损失的替代。
- 单词分析:
- likelihood:名词,词源来自“likely”(可能的),词义:可能性;似然。
- 记忆方法:“likely”(可能的)+“-hood”(名词后缀)→可能性。
- 形近词:likelihood/likely(可能的)、unlikelihood(不可能)。
- 发音解析:
- 音节分解:like + li + hood /ˈlaɪklihʊd/,重音在第一音节
- 规则:like → /laɪk/, “like” 发 /laɪk/ 音,其中 “l” 发 /l/ 音,“i” 发长元音 /aɪ/,“k” 发 /k/ 音。
- 规则:li → /li/, “li” 发 /li/ 音,其中 “l” 发 /l/ 音,“i” 发 /i/ 音。
- 规则:hood → /hʊd/, “hood” 发 /hʊd/ 音,其中 “h” 发 /h/ 音,“o” 发短元音 /ʊ/,“d” 发 /d/ 音。
- likelihood:名词,词源来自“likely”(可能的),词义:可能性;似然。
- The negative log - likelihood allows the model to estimate the conditional probability of the classes, given the input, and if the model can do that well, then it can pick the classes that yield the least classification error in expectation.
- 句子分析:并列复合句,由“and”连接两个分句。前一个分句中,“The negative log - likelihood”是主语,“allows”是谓语;后一个分句中包含“if”引导的条件状语从句。
- 翻译:负对数似然使模型能够在给定输入的情况下估计类别的条件概率,并且如果模型能够很好地做到这一点,那么它就可以选择在预期中产生最少分类误差的类别。
- 单词分析:
- conditional:形容词,词源来自“condition”(条件),词义:有条件的;附条件的。
- 记忆方法:“condition”(条件)+“-al”(形容词后缀)→有条件的。
- 形近词:conditional/condition(条件)、unconditional(无条件的)。
- 发音解析:
- 音节分解:con + di + tion + al /kənˈdɪʃənl/,重音在第二音节
- 规则:con → /kən/, “con” 发 /kən/ 音,其中 “c” 发 /k/ 音,“o” 发短元音 /ə/。
- 规则:di → /dɪ/, “di” 发 /dɪ/ 音,其中 “d” 发 /d/ 音,“i” 发短元音 /ɪ/。
- 规则:tion → /ʃn/, “tion” 发 /ʃn/ 音,其中 “t” 不发音,“i” 发短元音 /ɪ/,“o” 不发音,“n” 发鼻音。
- 规则:al → /l/, “al” 发 /l/ 音,其中 “a” 不发音,“l” 发 /l/ 音。
- conditional:形容词,词源来自“condition”(条件),词义:有条件的;附条件的。
- yield:动词,词源来自古英语“gieldan”(支付、给予),词义:产生;屈服。
- 记忆方法:联想“yield”音似“一代”,一代产生新的事物→产生。
- 形近词:yield/field(田地)、shield(盾牌)。
- 发音解析:
- 音节分解:y + ield /jiːld/,重音在第一音节
- 规则:y → /j/, “y” 发 /j/ 音。
- 规则:ield → /iːld/, “ield” 发 /iːld/ 音,其中 “i” 发长元音 /iː/,“e” 不发音,“l” 发 /l/ 音,“d” 发 /d/ 音。
- CHAPTER 8. OPTIMIZATION FOR TRAINING DEEP MODELS
- 翻译:“第8章. 深度模型训练的优化”
- In some cases, a surrogate loss function actually results in being able to learn more.
- 固定搭配:“result in”,含义:“导致;结果是”
- 句子分析:简单句,“In some cases” 为状语,“a surrogate loss function” 是主语,“results in” 是谓语,“being able to learn more” 是宾语。
- 翻译:“在某些情况下,替代损失函数实际上能让我们学到更多东西。”
- 单词分析:
- surrogate:名词,词源来自拉丁语 “surrogatus”,词义:“替代者;代理”,这里作形容词表示“替代的”。
- 记忆方法:联想 “sur-”(在……之上)+ “rog”(要求)+ “-ate”(动词后缀),别人要求你在上面帮忙,即替代者。
- 形近词:surrogate/surround(围绕)、surprise(惊喜)。
- 发音解析:
- 音节分解:sur + ro + gate /ˈsʌrəɡeɪt/,重音在第一音节
- 规则:sur → /sʌr/,“sur” 发 /sʌr/ 音,其中 “s” 发 /s/ 音,“u” 发短元音 /ʌ/,“r” 发 /r/ 音。
- 规则:ro → /rəʊ/,“ro” 发 /rəʊ/ 音,“o” 发长元音 /əʊ/。
- 规则:gate → /ɡeɪt/,“gate” 发 /ɡeɪt/ 音,“g” 发 /ɡ/ 音,“a” 发长元音 /eɪ/,“t” 发 /t/ 音。
- surrogate:名词,词源来自拉丁语 “surrogatus”,词义:“替代者;代理”,这里作形容词表示“替代的”。
- For example, the test set 0 - 1 loss often continues to decrease for a long time after the training set 0 - 1 loss has reached zero, when training using the log - likelihood surrogate.
- 句子分析:这是一个复合句,“when training using the log - likelihood surrogate” 是时间状语,“after the training set 0 - 1 loss has reached zero” 是时间状语从句,主句是 “the test set 0 - 1 loss often continues to decrease for a long time”。
- 翻译:“例如,当使用对数似然替代函数进行训练时,在训练集的0 - 1损失达到零之后,测试集的0 - 1损失通常还会在很长一段时间内持续下降。”
- 单词分析:
- likelihood:名词,词源来自 “like”(相似)+ “-hood”(表示状态、性质),词义:“可能性”。
- 记忆方法:“like” 有“像”的意思,“-hood” 表示状态,像某种情况的状态就是可能性。
- 形近词:likelihood/liken(把……比作)、likely(可能的)。
- 发音解析:
- 音节分解:like + li + hood /ˈlaɪklihʊd/,重音在第一音节
- 规则:like → /laɪk/,“like” 发 /laɪk/ 音,“l” 发 /l/ 音,“i” 发长元音 /aɪ/,“k” 发 /k/ 音。
- 规则:li → /lɪ/,“li” 发 /lɪ/ 音,“l” 发 /l/ 音,“i” 发短元音 /ɪ/。
- 规则:hood → /hʊd/,“hood” 发 /hʊd/ 音,“h” 发 /h/ 音,“oo” 发短元音 /ʊ/,“d” 发 /d/ 音。
- likelihood:名词,词源来自 “like”(相似)+ “-hood”(表示状态、性质),词义:“可能性”。
- This is because even when the expected 0 - 1 loss is zero, one can improve the robustness of the classifier by further pushing the classes apart from each other, obtaining a more confident and reliable classifier, thus extracting more information from the training data than would have been possible by simply minimizing the average 0 - 1 loss on the training set.
- 句子分析:这是一个复合句,“This is because...” 是主系表结构,“because” 引导表语从句,从句中 “even when the expected 0 - 1 loss is zero” 是时间状语从句,“one can improve...” 是主句,“by further pushing...” 是方式状语,“obtaining...” 和 “extracting...” 是现在分词短语作结果状语。
- 翻译:“这是因为,即使预期的0 - 1损失为零,人们也可以通过进一步使类别彼此分离来提高分类器的鲁棒性,从而获得一个更有信心和更可靠的分类器,因此从训练数据中提取的信息比仅仅最小化训练集上的平均0 - 1损失所能获得的信息更多。”
- 单词分析:
- robustness:名词,词源来自 “robust”(健壮的)+ “-ness”(名词后缀),词义:“鲁棒性;健壮性”。
- 记忆方法:由 “robust” 加名词后缀 “-ness” 构成,“robust” 是健壮的,所以 “robustness” 就是健壮性。
- 形近词:robustness/robust(健壮的)、rust(铁锈)。
- 发音解析:
- 音节分解:ro + bust + ness /rəʊˈbʌstnəs/,重音在第二音节
- 规则:ro → /rəʊ/,“ro” 发 /rəʊ/ 音,“o” 发长元音 /əʊ/。
- 规则:bust → /bʌst/,“bust” 发 /bʌst/ 音,“b” 发 /b/ 音,“u” 发短元音 /ʌ/,“s” 发 /s/ 音,“t” 发 /t/ 音。
- 规则:ness → /nəs/,“ness” 发 /nəs/ 音,“n” 发 /n/ 音,“e” 不发音,“s” 发 /s/ 音。
- robustness:名词,词源来自 “robust”(健壮的)+ “-ness”(名词后缀),词义:“鲁棒性;健壮性”。
- classifier:名词,词源来自 “classify”(分类)+ “-er”(表示人或物的后缀),词义:“分类器”。
- 记忆方法:“classify” 是分类的意思,“-er” 表示做某事的人或物,所以 “classifier” 就是分类器。
- 形近词:classifier/classify(分类)、classic(经典的)。
- 发音解析:
- 音节分解:class + i + fi + er /ˈklæsɪfaɪə(r)/,重音在第一音节
- 规则:class → /klɑːs/,“class” 发 /klɑːs/ 音,“c” 发 /k/ 音,“l” 发 /l/ 音,“a” 发长元音 /ɑː/,“s” 发 /s/ 音。
- 规则:i → /ɪ/,“i” 发短元音 /ɪ/。
- 规则:fi → /faɪ/,“fi” 发 /faɪ/ 音,“f” 发 /f/ 音,“i” 发长元音 /aɪ/。
- 规则:er → /ə(r)/,“er” 发 /ə(r)/ 音,“e” 不发音,“r” 发 /r/ 音。
- A very important difference between optimization in general and optimization as we use it for training algorithms is that training algorithms do not usually halt at a local minimum.
- 句子分析:这是一个主系表结构的句子,“A very important difference...” 是主语,“is” 是系动词,“that...” 引导表语从句。
- 翻译:“一般意义上的优化和我们用于训练算法的优化之间的一个非常重要的区别是,训练算法通常不会在局部最小值处停止。”
- 单词分析:
- optimization:名词,词源来自 “optimize”(优化)+ “-ation”(名词后缀),词义:“优化”。
- 记忆方法:由 “optimize” 加名词后缀 “-ation” 构成。
- 形近词:optimization/optimize(优化)、optimal(最优的)。
- 发音解析:
- 音节分解:op + ti + mi + za + tion /ˌɒptɪmaɪˈzeɪʃn/,重音在倒数第二个音节
- 规则:op → /ɒp/,“op” 发 /ɒp/ 音,“o” 发短元音 /ɒ/,“p” 发 /p/ 音。
- 规则:ti → /tɪ/,“ti” 发 /tɪ/ 音,“t” 发 /t/ 音,“i” 发短元音 /ɪ/。
- 规则:mi → /maɪ/,“mi” 发 /maɪ/ 音,“m” 发 /m/ 音,“i” 发长元音 /aɪ/。
- 规则:za → /zeɪ/,“za” 发 /zeɪ/ 音,“z” 发 /z/ 音,“a” 发长元音 /eɪ/。
- 规则:tion → /ʃn/,“tion” 发 /ʃn/ 音,“t” 不发音,“i” 不发音,“o” 不发音,“n” 发 /n/ 音。
- optimization:名词,词源来自 “optimize”(优化)+ “-ation”(名词后缀),词义:“优化”。
- halt:动词,词源来自古英语 “healdan”(抓住,停止),词义:“停止;暂停”。
- 记忆方法:联想 “halt” 发音像 “嚎停”,大声喊停就是停止。
- 形近词:halt/half(一半)、halt(跛行)。
- 发音解析:
- 音节分解:halt /hɔːlt/,重音在第一音节
- 规则:h → /h/,“h” 发 /h/ 音。
- 规则:al → /ɔːl/,“al” 发 /ɔːl/ 音,“a” 发长元音 /ɔː/,“l” 发 /l/ 音。
- 规则:t → /t/,“t” 发 /t/ 音。
- Instead, a machine learning algorithm usually minimizes a surrogate loss function but halts when a convergence criterion based on early stopping (Sec. ) is satisfied.
- 句子分析:这是一个并列复合句,由 “but” 连接两个分句,“when a convergence criterion based on early stopping (Sec. ) is satisfied” 是时间状语从句。
- 翻译:“相反,机器学习算法通常会最小化一个替代损失函数,但当基于早停(第……节)的收敛准则得到满足时就会停止。”
- 单词分析:
- convergence:名词,词源来自 “converge”(汇聚)+ “-ence”(名词后缀),词义:“收敛;汇聚”。
- 记忆方法:由 “converge” 加名词后缀 “-ence” 构成。
- 形近词:convergence/converge(汇聚)、convert(转变)。
- 发音解析:
- 音节分解:con + ver + gen + ce /kənˈvɜːdʒəns/,重音在第二音节
- 规则:con → /kən/,“con” 发 /kən/ 音,“c” 发 /k/ 音,“o” 发短元音 /ə/,“n” 发 /n/ 音。
- 规则:ver → /vɜː/,“ver” 发 /vɜː/ 音,“v” 发 /v/ 音,“e” 发长元音 /ɜː/,“r” 发 /r/ 音。
- 规则:gen → /dʒən/,“gen” 发 /dʒən/ 音,“g” 发 /dʒ/ 音,“e” 发短元音 /ə/,“n” 发 /n/ 音。
- 规则:ce → /s/,“ce” 发 /s/ 音。
- convergence:名词,词源来自 “converge”(汇聚)+ “-ence”(名词后缀),词义:“收敛;汇聚”。
- criterion:名词,词源来自希腊语 “kriterion”(标准),词义:“标准;准则”。
- 记忆方法:联想 “cri”(哭)+ “terion”(特里昂),哭着要达到特里昂定下的标准。
- 形近词:criterion/criteria(criterion的复数)、critic(批评家)。
- 发音解析:
- 音节分解:cri + te + ri + on /kraɪˈtɪəriən/,重音在第二音节
- 规则:cri → /kraɪ/,“cri” 发 /kraɪ/ 音,“c” 发 /k/ 音,“r” 发 /r/ 音,“i” 发长元音 /aɪ/。
- 规则:te → /tɪ/,“te” 发 /tɪ/ 音,“t” 发 /t/ 音,“e” 发短元音 /ɪ/。
- 规则:ri → /rɪ/,“ri” 发 /rɪ/ 音,“r” 发 /r/ 音,“i” 发短元音 /ɪ/。
- 规则:on → /ən/,“on” 发 /ən/ 音,“o” 发短元音 /ə/,“n” 发 /n/ 音。
更多推荐



所有评论(0)