Skip to content
vsMars
フィールドレポート

Mars Scoreの重みはどう較正されたか — 数字の背後にある方法論

vsMarsのすべての製品は0〜100のMars Scoreを持つ。算式は透明でカテゴリー固有だ。以下がカテゴリーごとの重みがどう選ばれ、なぜ変わり続けるかだ。

Buğra Sözeri··

vsMarsのすべての製品は0〜100のMars Scoreを持つ。それは雰囲気ではない。算式は我々の方法論で公開され、カテゴリーごとの重みはリポジトリでバージョン管理されている。以下がそれらの重みがどう選ばれるかだ。

Mars Score算式

カテゴリーC内の任意の製品Pについて:

MarsScore(P) = Σ_i (weight_i × normalize(spec_i(P), category_C))

各カテゴリーは(1)どの仕様キーが採点されるか、(2)それぞれの重み、(3)正規化カーブ(線形、対数、しきい値、区分)を定義する。

重みはどう選ばれるか

各カテゴリーについて我々は:

  1. レビュアーのコンセンサスを調査する。 カテゴリーのフラッグシップの30件以上のプロのレビューを読み、どの仕様が「決め手」「重要」「あれば嬉しい」と記述されるかを表にする。
  2. 購入者後悔データを調査する。 Redditスレッド、Amazonレビュー、返品率調査 — 購入者はどれをもっと重く評価すればよかったと願うか。
  3. 感度分析を実行する。 カテゴリーの20製品のサンプルについて、各重みを±20%変動させ、ランキングがコンセンサスに矛盾する形で動くかをチェックする。
  4. 重みを固定し、公開し、フィードバックを受け入れる。 フラッグシップのスコアがコンセンサスから意味のある形でずれて感じられるとき、その不一致は欠けている仕様か、較正ミスの重みのどちらかを明らかにする。

例:スマートフォン(2026年5月)

仕様キー重み根拠
battery_life_hours0.18調査での最大の後悔要因
chipset_score0.14複数年の寿命を予測
camera_main_score0.13主要な購入動機
display_score0.11日々の高い視認性
build_water_resistance0.07非対称な下振れ
update_years_promised0.07中期サイクルの価値
charging_w_wired + wireless0.06利便性だが上限効果あり
price_value0.10ティア横断の正規化
その他(12仕様)0.14ロングテール

これらの重みは2026年に2回変わった:iPhone 17 Pro Maxの熱スロットリング騒動の後、chipset_scoreの重みが上昇した(持続性能がピークより複数年体験の予測に優れることが判明した)。すべてのフラッグシップが80W以上に達した後、充電の重みが下がった(もはや差別化要因でない)。

正規化カーブ — 算式のもう半分

重みは仕様がどれだけ重要かを示す。正規化カーブは、所与の仕様値が0〜100のサブスコアにどうマッピングされるかを示す。我々は4つのカーブを使う:

  • 線形(minmax):カテゴリーの最小から最大を0〜100に線形マッピングする。リフレッシュレート、応答時間、ピーク輝度 — 改善の各単位がほぼ等しい仕様に使う。
  • 対数:ストレージ容量、RAMに使う — 倍増が漸進的な利得より重要な場合。
  • しきい値(二値):ブール仕様(has_anc、supports_dolby_vision)に使う — 有無。
  • 区分:非線形な価値を持つ仕様、例えばカメラのメガピクセル(12〜48 MPは重要だが48 MP超は収穫逓減)に使う。

正規化カーブは重みと並んでバージョン管理される。変更はスコア再計算ワーカーの監査ログに文書化される。

カテゴリーごとの重みの例

ヘッドホン(2026年5月):

  • ANC効果:0.17
  • 音質(ドライバサイズ + 周波数特性):0.16
  • バッテリー寿命:0.12
  • コーデック対応:0.10
  • マルチポイント:0.08
  • 快適性(重さ + クランプ):0.07
  • ビルド / 防水性:0.06
  • その他:0.24

ノートPC(2026年5月):

  • CPU/SoCスコア:0.16
  • バッテリー寿命(実世界):0.15
  • ディスプレイ品質(パネル + 解像度 + 輝度):0.13
  • ビルド品質 + 重さ:0.10
  • メモリ(RAM):0.08
  • ストレージ(SSD):0.07
  • ポート選択(USB-C、Thunderbolt):0.06
  • その他:0.25

我々が明示的にしないこと

  • レビュアーの感情スコアなし。 「フィール」は算式に入らない。主観的評価はスコアを再現不可能にする。
  • 人気ボーナスなし。 100万台売れたフラッグシップが、ニッチでより良い製品に勝つことはない。販売速度は市場シグナルであり、品質シグナルではない。
  • ブランドバイアスなし。 ブランドは仕様ではない。Mars ScoreはデバイスがApple、Samsung、無名OEMのどれからのものかを知らない。
  • カテゴリーの正規化を実質的に変えない限り価格割引なし。 価格はprice_value重みを通じて含まれるが、カテゴリー内で正規化される。200ドルのスマホは、価格/仕様比が良くても、絶対スコアで1,200ドルのスマホに勝つことはない。

なぜスコアは92.4 → 87.1 =「はるかに悪い」ではないのか

Mars Scoreは、任意のカテゴリーの生産中製品で60から95の間にクラスタする。5点の差は意味がある(異なるサブティア)。1.3点の差は方法論ノイズの範囲内だ(事実上引き分け)。数字をランキングの真実ではなくソートキーとして扱うこと。87.1の製品は92.4の製品より「5.7%悪い」のではない — 両者は同じ近隣にあり、特定のトレードオフで区別される。

なぜ我々は数式を公開するのか

他の比較サイトは不透明な「専門家評価」を公開する。Mars Scoreは意図的にその逆だ:すべての重み、すべての正規化カーブ、すべての仕様キーがバージョン管理にある。誰でもリポジトリをフォークし、重みを変え、スコアを再計算し、ランキングがどう変わるかを見られる。それが比較プラットフォームを正直にやる唯一の方法だ — あなたの重みは我々のものと違い、それでいい。あなたのものを代入できるほど数式はオープンであるべきだ。

完全なカテゴリーごとの重みはsrc/lib/score/mars.tsにある。誰でも数式を監査、再現、批判できる。より広いテストと採点のアプローチについては方法論ページを参照のこと。

カテゴリ
すべてのsmartphones比較を見る →